Cada mes actualizo aquí cuál es la mejor IA ahora mismo, la mejor IA del momento según el ranking independiente de Artificial Analysis, y de paso cuál sale más barata para tareas de volumen y qué modelo abierto va primero. Las notas son de ese ranking. El criterio es mío, el mismo con el que cierro el mensaje de cada día en el grupo.

Una cosa antes de la tabla: el primer puesto no decide por sí solo qué te conviene en una tienda o en una oficina. Compara también el precio, los límites de uso, adónde van tus datos y si la IA está dentro de la aplicación que ya usas.

La mejor IA ahora mismo: mi ranking de octubre de 2026

Así estaba el 1 de octubre de 2026:

Para qué Modelo Por qué
El mejor del mercado Claude Opus 5.5, de Anthropic 58 puntos en Artificial Analysis, la nota más alta con sus pruebas actuales
Calidad/precio en tareas medianas GPT-6.1 Sol, de OpenAI 52 puntos por 0,72 $ por tarea; Opus 5.5 al máximo gasta 5,98 $
Calidad/precio en tareas sencillas y de volumen GPT-6 Luna, de OpenAI 0,10 $ por millón de tokens de entrada y 0,50 $ de salida
Mejor modelo abierto MiMo-V2.6-Pro, de Xiaomi 46 puntos, el mejor de los que se pueden descargar
Harness favorito (el programa para trabajar con agentes) Claude Code Con Sonnet 5.5 a esfuerzo máximo, primero en ese índice

Este mes cambia la segunda línea. GPT-6.1 Sol, que OpenAI sacó el 29 de septiembre de 2026, se queda en 52 puntos, seis menos que Opus 5.5, pero en las pruebas de Artificial Analysis le cuesta 0,72 $ por tarea al máximo, y Opus 5.5 al máximo, 5,98 $. Son costes de API en esas pruebas: no equivalen a tareas incluidas en una suscripción. Lo tienes en los planes de pago de ChatGPT, Plus incluido. Opus 5.5 sigue liderando este índice y viene desde Claude Pro, a 18 € al mes más IVA (unos 22 €). Si ya pagas Claude, para el día a día prueba Sonnet 5.5 en esfuerzo medio. Anthropic lo recomienda a esfuerzos bajos para reducir el coste por tarea; Opus sigue destacando en trabajos complejos. Comprueba el consumo en tu cuenta.

Si no quieres pagar. Claude gratis usa Sonnet y Haiku, no Opus 5.5. Para mí, lo más completo gratis hoy es ChatGPT, que desde el 22 de septiembre de 2026 deja probar GPT-6 Luna en Work y Codex, dentro de su aplicación de escritorio. Si trabajas con Gmail y Drive, prueba Gemini. Y en cualquiera, desactiva que entrenen con tus conversaciones.

Las notas de los principales en la tabla general de Artificial Analysis, con el índice v4.3.2: esfuerzo máximo cuando existe, alto en los dos Gemini y xhigh en Grok. En Claude está activado el desvío de ciertas peticiones a otro modelo por seguridad, llamado «fallback». Son configuraciones concretas, no la nota de cualquier respuesta de su aplicación:

Modelo Nota Precio por millón de tokens
Claude Opus 5.5 (Anthropic) 58 4 $ / 20 $
Claude Sonnet 5.5 (Anthropic) 56 2 $ / 10 $
Claude Fable 5.1 (Anthropic) 53 10 $ / 50 $
GPT-6 Astra (OpenAI) 53 10 $ / 50 $
Gemini 4 Argon (Google) 53 2 $ / 10 $
GPT-6.1 Sol (OpenAI) 52 2 $ / 10 $
Muse Spark 1.3 (Meta) 48 1,25 $ / 4,25 $
Grok 4.7 (SpaceXAI) 46 2 $ / 6 $
MiMo-V2.6-Pro (Xiaomi) 46 0,435 $ / 0,87 $
GLM-5.3 (Zhipu, Z.ai) 45 1,40 $ / 4,40 $
Kimi K3 (Moonshot) 44 3 $ / 15 $
Gemini 3.8 Flash (Google) 41 0,75 $ / 3,75 $
GPT-6 Luna (OpenAI) 37 0,10 $ / 0,50 $

Precio de la API en dólares y sin IVA: entrada / salida, tarifa estándar sin caché, lotes ni recargos de herramientas. En OpenAI uso el tramo de contexto corto; el largo cuesta más. Meta corresponde al plan Standard y Xiaomi a la tarifa internacional. Los precios de Google son promocionales: Gemini 3.8 Flash, hasta el 31 de diciembre de 2026; Argon pasará a 4 $ / 20 $. Argon aún se limita a participantes autorizados y expertos en ciberseguridad, sin fecha pública para el resto.

Qué ha cambiado este mes

Desde el ranking anterior, del 24 de septiembre de 2026:

La fuente tiene una discrepancia: GPT-6 Luna figura con 37 en la tabla general y con 38 en su ficha individual. Uso 37 para mantener una sola tabla de referencia; esa diferencia no demuestra que el modelo haya mejorado. Compara siempre la misma versión del índice y configuración. Lo próximo anunciado: Haiku 5.5, que Anthropic prevé para las próximas semanas, y la ampliación del acceso a Argon.

La IA más inteligente del mundo, y cuándo no te hace falta

La primera línea es el modelo que mejor puntúa en este índice. Úsalo para lo que lleva dinero o un cliente de por medio, como un contrato de alquiler antes de firmarlo, y aun así comprueba cada cifra. Para contestar correos, resumir una reunión o sacar los totales de una hoja de ventas no te hace falta: cualquiera de los buenos lo hace bien, y muchos gratis.

Además, los modelos más listos te dejan elegir cuánto piensan antes de contestar, lo que llaman el esfuerzo. Al máximo rinden algo más, pero tardan bastante más y se comen tu límite de uso. Para el día a día, medio o alto sobra.

En tu trabajo pesan más otras cosas que dos puntos de nota:

  • Precio y límites. Empieza con el plan que ya tengas. Sube cuando hayas comprobado que necesitas una función o más capacidad; compara coste total, calidad y tiempo neto, incluida la revisión. Trabajar muchas horas con un agente no garantiza que un plan caro compense.
  • Tus datos. Con datos personales de clientes, comprueba antes la herramienta, el contrato y los permisos. Desactivar el entrenamiento no basta.
  • La aplicación que ya usas. Si vives en Gmail y Drive, Gemini ya está ahí; si vives en Word y Excel, Copilot.

Los precios en España, en qué IA pagar.

La que yo usaría para el trabajo de cada día

La segunda línea es para lo normal: un informe, un correo largo a un cliente, el Excel de ventas del trimestre. Busco el que mejor rinde por lo que cuesta, en dinero y en límite de uso.

Mi consejo: déjalo como tu modelo de siempre, en esfuerzo medio o alto, y sube al máximo cuando algo se te atasque. Si ya pagas ChatGPT Plus o Google AI Pro, no te cambies por unos puntos; muévete solo si tu plan se te queda corto.

La IA más barata para tareas de volumen

La tercera línea es para lo que haces en cantidad: clasificar correos, sacar datos de facturas, contestar las mismas preguntas de clientes. Eso casi nunca pasa por el chat. Se paga por uso, lo que llaman la API, desde una automatización o un agente, a tanto el millón de tokens, que son los trozos de texto con los que cobran.

Y el precio cambia muchísimo: en las pruebas de Artificial Analysis, a 1 de octubre de 2026, cada tarea le costaba a GPT-6 Luna unos 7 céntimos de dólar y a Opus 5.5 al máximo, casi 6 dólares. Tu clasificación de correos puede costar otra cantidad. Antes de montar nada, pídele a la IA que te haga la cuenta:

Cada mes recibo unos 2.000 correos de clientes, de media página cada uno, y quiero que una IA los clasifique en urgentes, presupuestos y el resto. Calcula cuántos tokens son y cuánto me costaría al mes con un modelo que cobra [precio de entrada] $ por millón de tokens de entrada y [precio de salida] $ de salida. Enséñame la cuenta.

Y prueba primero con veinte o treinta casos ficticios parecidos a tu trabajo.

El mejor modelo abierto y los modelos chinos

La cuarta línea es el mejor modelo de pesos abiertos: puedes descargarlo y ejecutarlo en tus servidores, pero debes revisar su licencia; «abierto» no significa siempre MIT o Apache. MiMo-V2.6-Pro sí usa MIT y supera el billón de parámetros. Mantener los datos dentro exige controlar también conexiones, herramientas y registros. Los modelos grandes requieren máquinas potentes; en un portátil puedes probar modelos pequeños con LM Studio u Ollama.

Desde hace meses, los mejores abiertos son chinos. Antes de usarlos:

  • Cuidado con sus aplicaciones. En la web o la app de DeepSeek, por ejemplo, lo que escribes se procesa en servidores chinos. En enero de 2025 el regulador italiano de protección de datos lo bloqueó (en italiano), y en España la OCU pidió a la Agencia Española de Protección de Datos que lo investigara. Mi regla: nada de datos de clientes en aplicaciones chinas.
  • La aplicación no es el modelo. Puedes instalar sus pesos tú o usar otro proveedor que los aloje. Comprueba dónde procesa los datos, qué registra y qué permite su contrato.
  • Comprueba sesgos y omisiones. En historia o política, contrasta las respuestas con fuentes; para el trabajo, prueba también los casos en los que podría omitir información importante.

En su informe de septiembre de 2026, Anthropic acusó a siete laboratorios chinos, entre ellos Xiaomi, Zhipu, Moonshot, Alibaba y DeepSeek, de sacar respuestas de Claude a gran escala para entrenar los suyos. De momento es una acusación, pero conviene saberlo.

Cómo leer los rankings de IA sin que te engañen

Artificial Analysis aplica diez pruebas en su índice v4.3.2, principalmente de texto en inglés. Agentes y documentos largos suman el 45 %; también evalúa programación, ciencia y conocimientos. No extrapoles una pequeña ventaja a tu trabajo: estima un intervalo de confianza del 95 % inferior a ±1 punto a partir de repeticiones en ciertos modelos, no una garantía para todos los casos. Y cambia el examen: Fable 5.1 tenía 66 puntos al publicarse y 53 con el índice posterior; eso no demuestra una pérdida de capacidad.

Arena, que hasta enero de 2026 se llamaba LMArena, compara respuestas a ciegas y recoge votos. Preferir una respuesta no garantiza que sea correcta. Desde julio de 2026 ofrece además un ajuste por exactitud factual en sus clasificaciones de texto y búsqueda. Comprueba qué vista, filtros, modelos y fecha estás comparando; no mezcles una clasificación por preferencias con otra que incluya ese ajuste.

Las gráficas de las propias empresas, tómalas como publicidad: cada una elige las pruebas que le favorecen.

Lo que más vale es probarlas con tu trabajo: en qué IA usar para cada cosa te explico cómo hacerlo en veinte minutos.

Historial: quién iba primero cada mes

Mes El más listo en Artificial Analysis El mejor modelo abierto
Junio de 2026 Claude Fable 5, desde el día 9 GLM-5.2, de Zhipu, desde el día 16
Julio de 2026 Claude Fable 5; desde el 24, Claude Opus 5 GLM-5.2; a final de mes, Kimi K3, de Moonshot
Agosto de 2026 Claude Opus 5 Kimi K3 y GLM-5.3 (reconstrucción retrospectiva)
Septiembre de 2026 Claude Fable 5.1, empatado luego con GPT-6 Astra; desde el 22, Claude Opus 5.5 GLM-5.3 y Kimi K3; al cierre, MiMo-V2.6-Pro, de Xiaomi

Este historial resume hitos documentados, no cada día del mes: Fable 5 el 9 de junio, GLM-5.2 el 16, Opus 5 el 24 de julio y Fable 5.1 el 1 de septiembre. Agosto es una reconstrucción a partir del balance de septiembre, no una captura conservada del cierre. Xiaomi fecha el lanzamiento de MiMo el 22 de septiembre; eso no fija el día exacto de entrada en el ranking. No comparo notas entre versiones distintas de las pruebas.

Si no quieres estar pendiente de todo esto, en cómo estar al día de la IA te cuento cómo filtro yo las noticias.

Revisión del 1 de octubre de 2026: notas, configuraciones, tarifas y límites de las comparaciones. Confirma la oferta vigente antes de contratar.

Fuentes, consultadas el 1 de octubre de 2026: ranking de modelos de Artificial Analysis, su comparador de agentes de programación, su análisis de Sonnet 5.5, GPT-6.1 Sol en Artificial Analysis, su análisis de Opus 5.5, su metodología, anuncio de Gemini 4 Argon de Google y su ficha en Artificial Analysis (en inglés), resumen del DevDay de OpenAI, precios de la API de Anthropic, OpenAI, Google, Meta, SpaceXAI, Xiaomi, Z.ai y Moonshot, precios de Claude, modelos de ChatGPT Work y Codex y clasificación de Arena.