Ir al contenido

Malpensador · malpensador.com

NoticiaInteligencia artificial9 min de lectura

Astra, Sol y Opus 5.5: la nueva carrera

Los modelos más recientes compiten en programación, agentes, uso de computadores y costo, pero sus benchmarks no son comparables sin contexto.

Redacción Malpensador

Fuente: OpenAI — GPT-6 Astra y GPT-6 Sol/Luna

La carrera por los modelos de inteligencia artificial entró en una etapa menos sencilla de explicar. Ya no se trata únicamente de preguntar cuál sistema escribe mejor: los modelos más nuevos intentan navegar, programar, usar computadores, investigar y completar trabajos de varias horas.

A septiembre de 2026, OpenAI tiene una familia encabezada por GPT-6 Astra y ampliada con GPT-6 Sol y GPT-6 Luna. Anthropic, por su parte, presentó Claude Opus 5.5 como su modelo más capaz de la familia Opus y como una versión orientada al trabajo prolongado con agentes, programación y tareas profesionales.

Astra: el modelo de máxima capacidad

OpenAI presenta GPT-6 Astra como su modelo de mayor capacidad para uso de computadores, navegación, programación, ciberseguridad, ciencia y trabajo profesional. La empresa reporta 98 % en FrontierMath Tier 4, 99,9 % en ARC-AGI-3 y 100 % en ExploitBench.

En uso de computadores, OpenAI compara Astra con GPT-5.6 Sol en OSWorld 2.0. Según la compañía, Astra obtuvo 72,6 % frente a 65,7 % de Sol y completó las tareas en aproximadamente 40 minutos, frente a 75 minutos. Es una diferencia relevante, aunque debe leerse como un resultado reportado por OpenAI y no como una prueba independiente.

La misma presentación afirma que Astra puede mantener contexto entre ventanas de trabajo, hacer preguntas cuando una decisión es importante y continuar de forma autónoma cuando faltan detalles menores. Ese cambio es significativo: el modelo no solo responde, sino que intenta decidir cuándo avanzar y cuándo pedir autorización.

Sol y Luna: bajar el costo de la inteligencia

OpenAI también lanzó GPT-6 Sol y GPT-6 Luna para tareas que no siempre necesitan la máxima capacidad de Astra. La compañía redujo a la mitad los precios de API frente a los precios promocionales de GPT-5.6: Sol pasó de 4 a 2 dólares por millón de tokens de entrada y de 20 a 10 dólares de salida; Luna pasó de 0,20 a 0,10 dólares de entrada y de 1,20 a 0,50 dólares de salida.

En AutomationBench, que evalúa flujos de trabajo empresariales con herramientas, OpenAI reporta para GPT-6 Sol un 33,2 %, frente a 30,3 % de Astra en baja intensidad y 26,9 % de Claude Opus 5 en máxima intensidad. La comparación no significa que Sol sea globalmente superior: muestra que el costo y el nivel de esfuerzo cambian el resultado.

En DeepSWE 1.1, una prueba de ingeniería de software en repositorios reales, OpenAI reporta 68,8 % para Sol y 69,9 % para Claude Fable 5.1, con un costo por tarea aproximadamente 80 % menor para Sol. En OSWorld 2.0, Sol obtuvo 60,5 %, frente a 60,3 % de Opus 5 en una comparación de esfuerzo medio, también con una diferencia de costo favorable para OpenAI.

Opus 5.5: eficiencia y trabajo prolongado

Anthropic presentó Claude Opus 5.5 el 22 de septiembre de 2026. La compañía asegura que cuesta aproximadamente 40 % menos que Opus 5 en cargas habituales y que usa menos tokens por tarea. Su precio publicado es de 4 dólares por millón de tokens de entrada y 20 dólares de salida.

En los resultados publicados por Anthropic, Opus 5.5 obtuvo 66,4 % en Terminal-Bench 4.0, 54,4 % en FrontierCode, 40 % en AutomationBench y 81,8 % en OSWorld 2.0. También alcanzó 1.846 puntos Elo en GDPval-AA v2.1, una evaluación de trabajo profesional en 44 ocupaciones.

Estos números colocan a Opus 5.5 muy cerca de Astra o por delante en algunas pruebas. Anthropic reporta, por ejemplo, 66,4 % de Opus 5.5 en Terminal-Bench frente a 57,9 % de GPT-6 Astra, aunque aclara que se usaron configuraciones de esfuerzo distintas y que sus propios resultados incluyen salvaguardas de producción.

¿Cuál es mejor?

No existe un ganador universal. Astra parece orientado a quien necesita la máxima capacidad disponible para tareas complejas, uso de computadores y decisiones de varios pasos. Sol y Luna buscan que una capacidad alta sea más barata y pueda utilizarse a gran escala. Opus 5.5 apuesta por agentes de programación, trabajo profesional prolongado y eficiencia en tokens.

El problema es que los benchmarks no son una tabla definitiva de inteligencia. Cada empresa elige pruebas, niveles de esfuerzo, herramientas, límites de tiempo y criterios de evaluación que pueden favorecer determinados usos. Además, un punto porcentual de diferencia puede ser menos importante que el precio, la velocidad, la seguridad o la facilidad para revisar lo que hizo el agente.

La competencia actual no se decide solo por quién obtiene el número más alto. Se decide por quién puede convertir ese resultado en trabajo confiable, a un costo sostenible y con suficiente transparencia para que una persona pueda supervisarlo. La próxima generación de modelos no será importante únicamente porque responda mejor, sino porque podrá hacerse cargo de tareas cada vez más completas.

Imagen: Imagen generada con IA

Óscar Fabián · Malpensador