Opus 5.5, GPT-6 Sol y Luna, MiMo V2.6 y Jev: la semana en que se movieron todos los modelos de IA (septiembre 2026)
Anthropic, OpenAI, Xiaomi y TypeSafe AI lanzaron modelos nuevos casi al mismo tiempo. Comparamos capacidades con datos de Artificial Analysis y te contamos qué es Jev, para qué sirve y sus alternativas open source.

Jesús Blanco
Autor

Esta semana pasó algo poco común: tres laboratorios de modelos de lenguaje actualizaron su lineup casi al mismo tiempo, y además apareció un tipo de modelo distinto que no genera texto. Anthropic lanzó Claude Opus 5.5, OpenAI amplió su familia GPT-6 con Sol y Luna, Xiaomi presentó MiMo V2.6 en abierto, y TypeSafe AI (fundada por un ex investigador de OpenAI) lanzó Jev, un modelo pensado para que el software tome decisiones rápidas en vez de conversar.
Si programas con IA todos los días, como hacemos en Fencode, esto no es solo curiosidad, es una actualización real de qué modelo conviene usar para cada tarea. En este artículo comparamos los lanzamientos con datos de Artificial Analysis, y dedicamos una sección aparte a explicar qué es Jev, para qué sirve y qué alternativas open source existen.
Claude Opus 5.5: el mismo nivel que Fable, pero más barato
Anthropic presentó Opus 5.5 como el primer modelo de su nueva familia 5.5, y también como el primero desde que la compañía anunció que iba a moderar el ritmo de lanzamientos de modelos frontera. Según Anthropic, Opus 5.5 rinde a un nivel parecido a Claude Fable 5.1 en la mayoría de las tareas, pero cuesta 40% menos de operar que Opus 5 y genera respuestas alrededor de 30% más rápido.
Su predecesor, Opus 5, ya lideraba el Artificial Analysis Intelligence Index con un puntaje de 61 en su configuración de máximo esfuerzo, empatado con Fable 5 y por delante de GPT-5.6 Sol (59) y Kimi K3 (57). Opus 5.5 es tan reciente que Artificial Analysis todavía no publica su propio puntaje independiente, así que por ahora solo tenemos las cifras que reporta Anthropic. Los precios bajaron de 5 a 4 dólares por millón de tokens de entrada y de 25 a 20 dólares por millón de salida.
Para quienes trabajamos con Claude Code o integraciones vía API, el cambio más relevante es justamente ese: rendimiento de gama alta a un costo más cercano al de un modelo intermedio.
GPT-6 Astra, Sol y Luna: OpenAI reordena su lineup
OpenAI ya había lanzado GPT-6 Astra a inicios de septiembre como su modelo más capaz hasta la fecha, con resultados destacados en uso de computadora, programación y ciencia. Según Artificial Analysis, Astra en su configuración "max" obtiene 61 puntos en el Intelligence Index, prácticamente empatado con Claude Opus 5, aunque a un precio notablemente más alto: unos $7.70 por millón de tokens frente a los $3.85 de Opus 5 en la misma comparación.
Esta misma semana la compañía amplió la familia GPT-6 sumando dos niveles adicionales, Sol y Luna, replicando la lógica que ya había usado con la generación anterior (GPT-5.6 también tenía sus propios Sol, Terra y Luna). La idea detrás de este esquema es simple: Astra queda como el nivel más potente y costoso, mientras que Sol y Luna ofrecen distintos balances entre inteligencia, velocidad y precio para quienes no necesitan la capacidad completa de Astra en cada tarea.
Un dato relevante para quienes evalúan riesgo: Anthropic reporta que Opus 5.5 alcanza niveles similares a Mythos 5.1 en biología y ciberseguridad, por lo que se lanza con las mismas salvaguardas que Fable 5.1. OpenAI también reforzó los controles de Astra en ciberseguridad, un área donde ambos laboratorios están siendo más cautelosos que en generaciones anteriores.
MiMo V2.6: Xiaomi se lleva el liderazgo open weights
El mismo día, Xiaomi presentó la serie MiMo V2.6, liderada por MiMo V2.6 Pro, un modelo de mezcla de expertos con más de un billón de parámetros totales (42 mil millones activos por token) y ventana de contexto de un millón de tokens. Según Artificial Analysis, MiMo V2.6 Pro obtuvo 46 puntos en su Intelligence Index, el puntaje más alto jamás registrado por un modelo open weights, superando a Kimi K3 y a la familia Qwen3.8. El costo estimado por tarea del índice es de apenas $0.13, lo que lo coloca en la frontera de Pareto entre inteligencia y costo.
La serie también incluye MiMo V2.6 Flash, pensado para cargas agénticas de alto volumen a menor costo, y una variante Pro UltraSpeed enfocada en velocidad de generación. Todo el lineup se publicó bajo licencia MIT en Hugging Face, así que cualquier equipo lo puede descargar, ajustar y desplegar sin pagar regalías.
Para equipos en LATAM que buscan reducir costos de inferencia sin sacrificar tanta capacidad, MiMo V2.6 se suma a la lista de alternativas abiertas junto a Kimi K3, GLM y DeepSeek, un tema que ya veníamos cubriendo en nuestra comparativa de modelos open source vs frontera.
Tabla comparativa
| Modelo | Laboratorio | Tipo | Artificial Analysis Intelligence Index | Precio API (entrada/salida por millón de tokens) |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | Cerrado | Sin puntaje independiente aún; Anthropic dice nivel Fable 5.1 | $4 / $20 |
| Claude Opus 5 (max) | Anthropic | Cerrado | 61 | $5 / $25 |
| GPT-6 Astra (max) | OpenAI | Cerrado | 61 | $10 / $50 (aprox. $7.70 por millón ponderado en AA) |
| GPT-6 Sol / Luna | OpenAI | Cerrado | 48 Sol / 37 Luna | Nivel medio y económico (por confirmar en API) |
| MiMo V2.6 Pro | Xiaomi | Abierto (MIT) | 46 (líder open weights) | Desde $0.44 / $0.87 |
| MiMo V2.6 Flash | Xiaomi | Abierto (MIT) | No evaluado aún por AA | Desde $0.14 / $0.28 |
Los precios de GPT-6 Sol y Luna todavía no están del todo consolidados en la documentación pública al momento de escribir esto, así que vale la pena revisar la página oficial de OpenAI antes de presupuestar un proyecto con ellos.
Jev: el modelo que no conversa, decide
Mientras los laboratorios grandes compiten por el modelo de chat más inteligente, TypeSafe AI tomó un camino distinto. Su fundador, Diogo Almeida, coinventó RLHF e InstructGPT en OpenAI antes de independizarse, y su primer producto, Jev, no es un LLM tradicional.
¿Qué es Jev? Es lo que TypeSafe llama un modelo "System One": en vez de generar texto token por token, recibe un estado (el contexto de tu programa) junto con preguntas tipadas, y responde con decisiones estructuradas (una opción, un puntaje o un booleano) acompañadas de una probabilidad calibrada. No tiene modo conversacional y sus salidas nunca se salen del esquema que vos definiste, así que técnicamente no puede alucinar un formato inválido.
¿Para qué sirve? Jev está pensado para las decisiones pequeñas y repetitivas que hoy resolés con un LLM de chat: clasificar un ticket de soporte, decidir qué herramienta debe usar un agente, evaluar si una acción es segura antes de ejecutarla, o puntuar la confianza de una respuesta. TypeSafe reporta tiempos de respuesta de 70 a 500 milisegundos y afirma que Jev es hasta 100 veces más rápido y más barato que un LLM convencional en estas tareas, aunque esas cifras salen de sus propios benchmarks.
Casos de uso reales que ya se reportaron:
- Enrutamiento de agentes: elegir qué modelo o herramienta debe encargarse de una tarea antes de invocarlo.
- Guardrails de seguridad: revisar comandos o acciones de un agente antes de ejecutarlos, como reemplazo de un clasificador basado en un LLM de chat.
- Clasificación de tickets y correos: un equipo reportó resultados de 5 a 18 veces más rápidos al reemplazar un modelo de chat por Jev en esta tarea.
- Monitoreo de agentes: usar Jev para vigilar las trazas de otro agente y detectar intentos de jailbreak o desvíos de tarea.
Alternativas open source. Jev es de pesos cerrados y solo se usa vía API, así que en días surgió un ecosistema de proyectos que intentan reproducir la misma interfaz (decisión tipada más probabilidad calibrada) con modelos abiertos que corren en tu propia infraestructura. Algunos de los más mencionados:
- OpenJev, el proyecto que dio nombre a la categoría de "alternativas abiertas a Jev", con varias implementaciones independientes bajo ese paraguas.
- poorjev, una reproducción local de la interfaz Choice/Score/Noul sobre modelos de clasificación zero-shot, con foco en calibración honesta de confianza y sin necesidad de conexión a internet.
- von, un modelo no autoregresivo de 395 millones de parámetros entrenado para responder preguntas tipadas con probabilidades calibradas en menos de 15 milisegundos.
Ninguna de estas opciones es un calco exacto de Jev (TypeSafe no liberó los pesos ni el método de entrenamiento RLCD), pero sí replican la idea central: un modelo chico y rápido que devuelve decisiones estructuradas en vez de texto libre, útil si preferís no depender de una API externa para decisiones de bajo riesgo dentro de tus flujos de agentes.
¿Cuál conviene según tu caso de uso?
- Si programás a diario con un agente tipo Claude Code: Opus 5.5 es la actualización más directa, mismo nivel de calidad que Fable pero más barato y rápido.
- Si necesitás uso de computadora o automatización de navegador: GPT-6 Astra lidera ahí, aunque a un precio más alto.
- Si buscás reducir costos de inferencia en producción: MiMo V2.6 Flash o Pro son opciones abiertas muy competitivas, sobre todo para cargas agénticas de alto volumen.
- Si tu agente necesita tomar decenas de decisiones pequeñas por segundo (routing, clasificación, guardrails): ahí Jev, o una de sus alternativas open source, tiene más sentido que llamar a un LLM de chat completo.
- Si tu prioridad es un balance entre costo y capacidad dentro del ecosistema OpenAI: vale la pena esperar los detalles finales de precios de Sol y Luna antes de migrar.
Como siempre, la recomendación real es correr tus propios benchmarks con tareas representativas de tu stack, los números de marketing no siempre se trasladan igual a un caso de uso concreto.
Preguntas frecuentes
¿Opus 5.5 reemplaza a Claude Fable 5.1?
No exactamente. Anthropic dice que Opus 5.5 rinde a un nivel similar a Fable 5.1 en la mayoría de las tareas, pero Fable sigue siendo el modelo de mayor capacidad de la compañía.
¿GPT-6 Sol y Luna son gratis?
No, son modelos de pago dentro del ecosistema de OpenAI, con distintos niveles de precio según capacidad, similar a como funcionaba la familia GPT-5.6.
¿MiMo V2.6 se puede usar en producción?
Sí, está publicado bajo licencia MIT en Hugging Face, así que se puede descargar y desplegar libremente, aunque como con cualquier modelo abierto conviene validar el rendimiento con tus propias pruebas antes de llevarlo a producción.
¿Jev reemplaza a un LLM de chat como Claude u OpenAI?
No, son complementarios. Jev sirve para decisiones estructuradas y de bajo riesgo dentro de un flujo de software, no para conversación abierta ni generación de contenido, que sigue siendo terreno de los LLM tradicionales.
¿Existe una versión open source oficial de Jev?
No. TypeSafe no liberó los pesos del modelo. Lo que existe son reproducciones independientes de la misma idea, como OpenJev, poorjev y von, que no están afiliadas a TypeSafe AI.
Artículos relacionados
- GPT-5.6 Sol vs Kimi K3: comparativa
- Open source vs modelos frontera 2026
- Modelos de IA baratos 2026: arma tu stack económico
En Fencode ayudamos a equipos a elegir el stack de IA correcto para su producto y a integrarlo en flujos reales. Si te interesa una consultoría tecnológica o armar un stack a medida, escribinos.



