Saltar al contenido principal
Todos los artículos

Español · 8 min de lectura

El mejor modelo de IA para programar en octubre de 2026: GPT-6.1 Sol vs Claude Opus 5.5 vs Sonnet 5.5 (y Gemini 4 Argon, que todavía no se puede comprar)

Claude Opus 5.5 lidera las pruebas independientes de programación que seguimos. GPT-6.1 Sol y Claude Sonnet 5.5 cuestan la mitad, 2 $ / 10 $ por millón de tokens, y Gemini 4 Argon de Google aún no está a la venta. Precios, puntuaciones con fuente, qué plan de programación combinar con cada uno y cuál usar para cada tarea.

Por Dapols ·

La respuesta corta: para el trabajo de programación más difícil, usa Claude Opus 5.5. Tiene las puntuaciones más altas de programación y de programación agéntica de cualquier modelo cerrado en LiveBench, y Artificial Analysis lo sitúa primero de 223 modelos en general. Para programar en el día a día, GPT-6.1 Sol o Claude Sonnet 5.5 cuestan la mitad por token (2 $ / 10 $ por millón) y te llevan casi igual de lejos. De los tres, GPT-6.1 Sol fue el más barato por tarea terminada en la prueba de Artificial Analysis. Si quieres pesos abiertos o programación agéntica muy barata, DeepSeek V4.1 Flash encabeza la tabla de programación agéntica de LiveBench por unos tres céntimos por tarea resuelta. Gemini 4 Argon parece fuerte según las cifras de la propia Google, pero todavía no se puede comprar.

Cada cifra de abajo indica quién la midió: el propio laboratorio o uno de dos sitios de benchmarks independientes, Artificial Analysis y LiveBench. Las cifras de LiveBench son de nuestra captura del 1 de octubre de 2026. Revisado el 1 de octubre de 2026. Los precios son precios de lista por millón de tokens en la API de cada laboratorio.

Los modelos para programar, lado a lado

Claude Opus 5.5Claude Sonnet 5.5GPT-6.1 SolDeepSeek V4.1 FlashGemini 4 Argon
LaboratorioAnthropicAnthropicOpenAIDeepSeekGoogle
FechaLanzado el 22 sep 2026Lanzado el 28 sep 2026Lanzado el 29 sep 2026Lanzado el 10 sep 2026Anunciado el 30 sep 2026
Precio entrada / salida4 $ / 20 $2 $ / 10 $2 $ / 10 $0,15 $ / 0,60 $ fuera de hora punta, el doble en hora punta2 $ / 10 $ de lanzamiento, luego 4 $ / 20 $ (anunciado)
Artificial Analysis Intelligence Index (independiente)58, n.º 1 de 2235652, n.º 11 de 22339 (captura del 23 sep)53, n.º 8 de 223
LiveBench programación (independiente, captura del 1 oct 2026)89,388,980,4——
LiveBench programación agéntica (independiente, captura del 1 oct 2026)71,739,354,577,3—
LiveBench coste por tarea resuelta (independiente, captura del 1 oct 2026)unos 0,80 $unos 0,14 $unos 0,14 $unos 0,03 $—
¿Se puede comprar hoy?Sí, API de Claude y las grandes nubesSí, API de Claude, apps de Claude y Claude CodeSí, API, más Codex y ChatGPT Work en planes de pagoSí, API, o ejecutar tú mismo los pesos con licencia MITNo. Solo defensores de ciberseguridad verificados

Un guion significa que no tenemos una cifra de esa fuente que citar. Las puntuaciones del índice son de las páginas de Artificial Analysis de Opus 5.5, Sonnet 5.5, GPT-6.1 Sol y Gemini 4 Argon, consultadas el 1 de octubre de 2026 salvo que se indique otra fecha de captura. El anterior GPT-6 Sol, al que GPT-6.1 Sol sustituye al mismo precio, sacó 48 en ese índice y 81,8 en programación de LiveBench.

Destacan dos cosas. Opus 5.5 lidera las dos columnas de programación entre los modelos cerrados. Y GPT-6.1 Sol no es mejor que Sonnet 5.5 en todo: Sonnet 5.5 puntúa más en programación de LiveBench, GPT-6.1 Sol puntúa más en programación agéntica, y los dos cuestan unos 0,14 $ por tarea resuelta en LiveBench.

Lo que publica cada laboratorio, y por qué no se puede comparar entre sí

Estas son cifras de los propios laboratorios, no pruebas independientes. Cada laboratorio eligió benchmarks distintos, así que una cifra de una lista no se puede comparar con una de otra.

Cifras de la propia Anthropic (Opus 5.5, Sonnet 5.5):

PruebaOpus 5.5Sonnet 5.5
Terminal-Bench 4.0, programación agéntica en línea de comandos66,4 %70,6 %
CursorBench 4.0, programación dentro de un editor57,8 %55,5 %
FrontierCode 1.1 (main, esfuerzo xhigh)54,4 %52,1 %

Cifras de la propia OpenAI sobre GPT-6.1 Sol (fuente). OpenAI publicó sobre todo comparaciones, no puntuaciones directas:

  • DeepSWE v1.1, ingeniería de software de largo recorrido: iguala a GPT-6 Astra a cerca de una quinta parte del coste, y supera en 6,4 puntos el mejor resultado de GPT-6 Sol con menos esfuerzo.
  • AutomationBench, flujos de trabajo de negocio: 2,2 puntos por encima de Claude Opus 5.5 con esfuerzo medio, a cerca de un tercio del coste.
  • Terminal-Bench Science 0.1: 5,47 $ por tarea con esfuerzo máximo, frente a 23,21 $ de Opus 5.5 y 23,80 $ de GPT-6 Astra. Astra sigue siendo el que más puntúa ahí, con un 68,1 %.

Cifras publicadas por Google sobre Gemini 4 Argon (fuente): 77,9 % en DeepSWE v1.1, que Google llama un nuevo estado del arte; 51,3 % en AutomationBench, en primer puesto; y 68 % en CWE-bench v1, corrección de vulnerabilidades, empatado en primer puesto. Bloomberg ha informado de escepticismo interno en Google sobre el rendimiento de Argon en programación, otra razón para esperar a puntuaciones independientes.

Terminal-Bench 4.0 y Terminal-Bench Science 0.1 son pruebas distintas. OpenAI no publicó un porcentaje de DeepSWE para GPT-6.1 Sol, así que su resultado no se puede poner junto al 77,9 % de Google. Por eso la tabla de arriba se apoya en los dos sitios independientes, donde todos los modelos hacen las mismas pruebas.

Más barato por token no siempre es más barato por trabajo

GPT-6.1 Sol y Sonnet 5.5 tienen el mismo precio de lista, 2 $ / 10 $. En la prueba del índice de Artificial Analysis, con el esfuerzo más alto de cada modelo, el coste medio por tarea salió en unos 0,72 $ para GPT-6.1 Sol (captura del 1 oct), 5,98 $ para Opus 5.5 y 7,60 $ para Sonnet 5.5 (ambos de la captura del 29 sep). Artificial Analysis califica a Sonnet 5.5 de «very verbose»: escribió mucha más salida que los demás, y la salida es la parte cara.

LiveBench cuenta una historia más suave. Allí, GPT-6.1 Sol y Sonnet 5.5 cuestan unos 0,14 $ por tarea resuelta, y Opus 5.5 unos 0,80 $. La diferencia depende del nivel de esfuerzo. Claude Code usa esfuerzo medio por defecto, así que una factura real de Sonnet 5.5 en Claude Code no se parecerá a la prueba con esfuerzo máximo. Empieza con el valor por defecto y súbelo solo cuando falle una tarea real. Más en nuestra comparativa Sonnet 5.5 vs Opus 5.5 vs GPT-6 Sol.

La regla de los 272K en GPT-6.1 Sol

GPT-6.1 Sol tiene una ventana de contexto de 1.050.000 tokens, pero un prompt de más de 272.000 tokens de entrada factura toda la petición al doble del precio de entrada y a 1,5 veces el de salida. Eso son 4 $ / 15 $ por millón en vez de 2 $ / 10 $. Los agentes de programación que cargan un repositorio grande en un solo prompt pueden cruzar ese límite sin que te des cuenta. Anthropic factura los dos modelos de Claude a la tarifa estándar en toda su ventana de 1 millón.

La caché ayuda en el lado de OpenAI: la entrada en caché de GPT-6.1 Sol cuesta 0,10 $ por millón, la mitad de los 0,20 $ de GPT-6 Sol.

Qué plan de programación combinar con cada modelo

Si programas tú mismo con un asistente de IA, un plan mensual fijo suele salir más barato que pagar por token. Son precios de lista de nuestro catálogo. Los límites de uso cambian a menudo, así que revísalos antes de comprar.

Si eligesCombínalo conPrecio de lista
Claude Opus 5.5 o Sonnet 5.5Claude Code, incluido en Claude Pro o MaxPro 20 $ al mes (200 $ al año con pago anual); Max desde 100 $ al mes por 5 veces el uso de Pro, con un nivel 20x más caro
GPT-6.1 SolCodex, incluido en ChatGPT Plus o Pro. OpenAI dice que GPT-6.1 Sol ya está en Codex para usuarios de Plus, Pro, Business, Enterprise y EduPlus 20 $ al mes; Pro desde 100 $ al mes (niveles de 100 $, 200 $ y 500 $, solo mensual)
Modelos de varios laboratorios en un editorCursor Pro20 $ al mes (192 $ al año con pago anual)
Automatización o tu propia appLa API del laboratorio, pago por tokenVer la fila de precios en la tabla de arriba

Algunas notas:

  • Claude Code funciona en tu terminal y en extensiones del IDE. Max sobre todo compra más uso, así que empieza con Pro y sube solo si llegas a los límites. Nuestra guía Cursor vs Claude Code explica cuál encaja con cómo trabaja tu equipo.
  • Codex es donde OpenAI puso primero GPT-6.1 Sol. Todavía no está en el chat normal de ChatGPT. OpenAI dice que un «GPT-6.1 Sol Ultrafast» más rápido, con generación de tokens hasta 8 veces más rápida en Codex, llegará «en los próximos días».
  • Cursor es un editor que te deja elegir modelos de varios laboratorios. Comprueba en su lista que están los modelos de arriba antes de comprometerte.
  • DeepSeek V4.1 Flash no tiene suscripción. Pagas por token, y la API de DeepSeek tiene un endpoint con formato de Anthropic, así que se puede conectar a Claude Code.

Qué modelo para cada trabajo

TrabajoNuestra elecciónPor qué
Refactorizaciones grandes, bugs difíciles, ejecuciones largas de agentesClaude Opus 5.5Las puntuaciones más altas de programación y programación agéntica de LiveBench entre los modelos cerrados, y n.º 1 en Artificial Analysis
Programación diaria en la que importa el coste por trabajo terminadoGPT-6.1 SolEl más barato por tarea de los tres en Artificial Analysis, precio de lista 2 $ / 10 $
Programación diaria con un plan de ClaudeClaude Sonnet 5.588,9 en programación de LiveBench a la mitad del precio por token de Opus 5.5; deja el esfuerzo por defecto
Bucles de agentes muy baratos, o código que debe quedarse en tus servidoresDeepSeek V4.1 FlashN.º 1 en programación agéntica de LiveBench por unos 0,03 $ por tarea resuelta, pesos con licencia MIT
Cualquier cosa que necesite Gemini 4 ArgonEsperarNo está a la venta; vuelve a probar cuando llegue a la API de Gemini o a Google AI Ultra

Una advertencia sobre DeepSeek V4.1 Flash: encabeza la tabla de programación agéntica de LiveBench, pero saca 39 en el índice más amplio de Artificial Analysis (captura del 23 sep). Los benchmarks no coinciden, así que pruébalo con tu propio código antes de pasar a todo un equipo.

Gemini 4 Argon: lo que sabemos

Google anunció Gemini 4 Argon el 30 de septiembre de 2026 como su nuevo modelo de frontera para ingeniería de software de largo recorrido, trabajo legal y financiero y ciberdefensa, con un límite de salida de 1 millón de tokens, frente a 64.000 antes. En el lanzamiento solo se está desplegando para defensores de ciberseguridad verificados a través del programa Fairwind de Google, mientras Google pasa por el proceso voluntario de acceso previo del Gobierno de EE. UU. Google dice que los clientes de pago de la API y los suscriptores de Google AI Ultra serán los primeros cuando se abra, «lo antes posible», sin fecha. El precio anunciado es de 2 $ / 10 $ por millón al principio y luego de 4 $ / 20 $. Mientras no se pueda comprar, no debería cambiar tus planes.

Nuestro rastreador de modelos mantiene la elección actual para programar y para cada otra categoría, con fuentes. Si quieres una configuración de programación elegida para tu propio equipo y presupuesto, eso es lo que hace un Plan de IA para empresas. El buscador de plan de IA gratuito de 2 minutos es el primer paso rápido.

Preguntas frecuentes

¿Cuál es el mejor modelo de IA para programar en octubre de 2026? Claude Opus 5.5, si quieres los mejores resultados: tiene las puntuaciones más altas de programación (89,3) y programación agéntica (71,7) de cualquier modelo cerrado en LiveBench (captura del 1 oct 2026) y es el primero en Artificial Analysis. Para el trabajo diario a la mitad del precio por token, usa GPT-6.1 Sol o Claude Sonnet 5.5.

¿Es GPT-6.1 Sol mejor que Claude Opus 5.5 para programar? No en las pruebas independientes. Opus 5.5 puntúa más en programación y programación agéntica de LiveBench y en Artificial Analysis (58 frente a 52). GPT-6.1 Sol cuesta la mitad por token y mucho menos por tarea. Las cifras de la propia OpenAI lo sitúan 2,2 puntos por encima de Opus 5.5 en AutomationBench, que es una prueba de flujos de negocio, no de programación.

¿Puedo usar ya Gemini 4 Argon? No. Google lo anunció el 30 de septiembre de 2026, pero solo está disponible para defensores de ciberseguridad verificados. Google dice que los clientes de pago de la API y los suscriptores de Google AI Ultra irán primero, sin fecha.

¿Cuánto cuesta GPT-6.1 Sol? 2 $ por millón de tokens de entrada y 10 $ por millón de tokens de salida, con la entrada en caché a 0,10 $. Un prompt de más de 272.000 tokens de entrada factura toda la petición a 4 $ / 15 $.

¿Qué plan de programación debería comprar un desarrollador independiente? Empieza con un plan de 20 $ que encaje con el modelo que prefieres: Claude Pro para Claude Code, ChatGPT Plus para Codex con GPT-6.1 Sol, o Cursor Pro si quieres un editor con modelos de varios laboratorios. Sube solo cuando llegues a los límites de uso.

¿Ya salió Claude Haiku 5.5? Sí, el 7 de octubre de 2026 (actualización, 8 de octubre). Cuesta 0,10 $ / 0,50 $ por millón de tokens para prompts de hasta 100K tokens, frente a 1 $ / 5 $ de Haiku 4.5, y Anthropic reporta un 39,2 % en Terminal-Bench 4.0 con esfuerzo máximo, muy por detrás de Claude Sonnet 5.5 y Opus 5.5. Es un modelo barato para tareas de alto volumen, no una opción para programar.

Fuentes: OpenAI — Introducing GPT-6.1 Sol, OpenAI — página del modelo GPT-6.1 Sol, Google — Gemini 4 Argon, Anthropic — Claude Opus 5.5, Anthropic — Claude Sonnet 5.5, precios de DeepSeek, Artificial Analysis — GPT-6.1 Sol, Artificial Analysis — Gemini 4 Argon, Artificial Analysis — Claude Opus 5.5, Artificial Analysis — Claude Sonnet 5.5, LiveBench. Revisado el 1 de octubre de 2026.