Última actualización: Septiembre 2026
¿Es Codex mejor que Claude Code en 2026?
En la decisión Codex vs Claude Code, ninguna herramienta gana todas las pruebas. En una ejecución independiente de Terminal-Bench 4.0, GPT-6 Astra, de OpenAI Codex, cuesta menos de la mitad por tarea. Claude Opus 5.5, el modelo por defecto de Claude Code de Anthropic, puntúa más alto. Para una empresa, lo decisivo es el coste por tarea, dónde se ejecuta el agente y cuánto puede hacer sin supervisión.
OpenAI lanzó GPT-6 Astra el 3 de septiembre y GPT-6 Sol y Luna el 22. Anthropic lanzó Claude Opus 5.5 el 22 de septiembre y Claude Sonnet 5.5 el 28. Esta guía los compara solo con fuentes publicadas y fechadas.
TL;DR: puntos clave
- Benchmark independiente: en la prueba de Terminal-Bench 4.0 de Vals AI, Claude Opus 5.5 logra un 61,62 % a 19,07 $ por tarea. GPT-6 Astra marca un 57,07 % a 8,21 $ y Claude Sonnet 5.5 un 53,03 % a 19,33 $.
- Producto contra producto: en la clasificación oficial de Terminal-Bench 4.0, Codex con GPT-6 Astra marca un 58,2 % y Claude Code con Fable 5.1 un 57,9 %. Es un empate estadístico.
- Datos del fabricante: Anthropic declara un 70,6 % para Sonnet 5.5 y OpenAI un 57,9 % para GPT-6 Astra.
- Precios: ambos empiezan en 20 $ al mes y cobran 25 $ por puesto de equipo con pago mensual, según Codex y Claude. Solo Codex tiene plan gratuito.
- Adopción: Claude Code llegó al 39 % de uso en el trabajo y Codex al 16 % a mediados de 2026, según JetBrains Research.
- Seguridad: ambos han corregido fallos críticos explotables desde un repositorio, como la CVE-2025-61260 de Codex (CVSS 9,8) y la CVE-2026-39861 de Claude Code (CVSS 10,0).
De un vistazo: diferencias clave en 2026
| OpenAI Codex | Anthropic Claude Code | |
|---|---|---|
| Producto | Agente en la app de ChatGPT, CLI, IDE y nube | Agente en terminal, IDE, escritorio, web y móvil |
| Modelos actuales | GPT-6 Astra, Sol y Luna | Claude Opus 5.5, Sonnet 5.5 y Fable 5.1 |
| Contexto | GPT-6 Sol: 1.050.000 tokens | Opus 5.5 y Sonnet 5.5: 1M de tokens |
| Precio más alto (1M de tokens) | GPT-6 Astra: 10 $ / 50 $ | Opus 5.5: 4 $ / 20 $ |
| Planes individuales | Free, Go 8 $, Plus 20 $, Pro desde 100 $ | Pro 20 $, Max desde 100 $ |
| Puesto de equipo | Business: 25 $ mensual, 20 $ anual | Team Standard: 25 $ mensual, 20 $ anual |
| Revisión de código | @codex review en GitHub, GitLab en beta | Code Review en GitHub (research preview) |
| Modelos también en | Microsoft Azure, Amazon Bedrock | Amazon Bedrock, Google Cloud, Microsoft Foundry |
| Ideal para | Coste por tarea, tareas paralelas en la nube | Terminal, automatización en CI, Google Cloud |
¿Qué son OpenAI Codex y Claude Code en 2026?
Codex y Claude Code son agentes de código con IA que leen un repositorio, editan archivos y ejecutan comandos. Elegir uno es también elegir GPT-6 o Claude 5.5 como familia de modelos.
OpenAI Codex: el agente dentro de ChatGPT
Codex funciona en la app de ChatGPT, una extensión de IDE, la CLI y Codex cloud. Esta última ejecuta tareas "en entornos cloud aislados" lanzadas desde la web, GitHub, GitLab, Linear o Slack, según la documentación de Codex cloud. La CLI tiene licencia Apache-2.0 y unas 127.000 estrellas en GitHub.
La página de modelos incluye GPT-6 Astra, el "más capaz", Sol para código y flujos agénticos, y Luna para alto volumen. La CLI 0.157.0, del 25 de septiembre, añadió Sol y Luna con Amazon Bedrock, según el changelog de Codex. OpenAI anunció 8 millones de usuarios activos entre Codex y ChatGPT Work en julio, según The New Stack.
Claude Code: la herramienta agéntica de Anthropic
La documentación de Anthropic describe Claude Code como una herramienta agéntica que "lee tu código, edita archivos y ejecuta comandos". También funciona en Slack, GitHub Actions y GitLab CI/CD.
La versión 2.1.280 hizo de Claude Opus 5.5 el modelo Opus por defecto y la 2.1.284 hizo lo mismo con Claude Sonnet 5.5. Ambos tienen 1M de tokens de contexto, según el changelog de Claude Code. Anthropic afirma que Sonnet 5.5 responde "más de un 30 % más rápido" que Sonnet 5, al mismo precio.
Benchmarks de Codex vs Claude Code: qué dicen los datos
En pruebas independientes, Claude Opus 5.5 logra la mejor puntuación en Terminal-Bench 4.0 y GPT-6 Astra el menor coste por tarea entre los modelos punteros. La única comparación pública por producto, con cada agente y su propio modelo, deja a Codex y Claude Code empatados.
Terminal-Bench 4.0: fabricante frente a pruebas independientes
| Modelo | Fabricante | Vals AI | Coste por tarea (Vals) |
|---|---|---|---|
| Claude Opus 5.5 | 66,4 % (Anthropic) | 61,62 % | 19,07 $ |
| GPT-6 Astra | 57,9 % (OpenAI) | 57,07 % | 8,21 $ |
| Claude Sonnet 5.5 | 70,6 % (Anthropic) | 53,03 % | 19,33 $ |
| GPT-6 Sol | No publicado | 34,34 % | No indicado |
Fuentes: Anthropic, OpenAI, Vals AI (27 de septiembre de 2026).
Vals ejecuta todos los modelos con un mismo agente neutral, Terminus 2, en tres pasadas. Avisa de que 30 de los 198 intentos de Opus 5.5 los sirvieron modelos Claude anteriores; sin ellos, queda en un 53,54 %. Sonnet 5.5 muestra la mayor brecha entre lo declarado y lo medido, así que toma las cifras del fabricante como techo.
Codex vs Claude Code como productos
La clasificación oficial de Terminal-Bench 4.0, de Harbor y el Laude Institute con Snorkel AI, ordena parejas de agente y modelo. Codex con GPT-6 Astra lidera con un 58,2 % (±2,8), por delante de Claude Code con Fable 5.1, con un 57,9 % (±3,8). A 29 de septiembre no había entradas de Claude Code con modelos 5.5.
FrontierCode, DeepSWE y CursorBench
| Benchmark (quién lo publica) | Modelos de Codex | Modelos de Claude Code |
|---|---|---|
| FrontierCode 1.1 (Anthropic) | Astra 53,3 %, Sol 49,3 % | Opus 5.5 54,4 %, Sonnet 5.5 52,1 % |
| DeepSWE v1.1 (OpenAI) | Astra 74,1 %, Sol 68,8 %, Luna 66,6 % | Fable 5 69,9 %, Opus 5 66,0 % (sin 5.5) |
| CursorBench 4.0 (Cursor) | GPT-5.6 Sol 41,7 % (sin GPT-6) | Opus 5.5 57,8 %, Sonnet 5.5 55,5 % |
Fuentes: Anthropic, OpenAI, Vellum, CursorBench 4.0.
Cada proveedor elige benchmarks favorables. Para la visión por modelo, consulta nuestra guía de Claude Opus 5.5 para empresas y nuestro análisis de GPT-6 Astra para CISO.
¿Qué ha pasado con SWE-bench?
OpenAI dejó de publicar SWE-bench Verified en febrero de 2026 al ver que al menos el 59,4 % de los problemas auditados tenían tests defectuosos, según su análisis. Recomienda SWE-bench Pro, pero la clasificación de Scale no había evaluado GPT-6 ni Claude 5.5 a 29 de septiembre.
Cómo hemos comparado Codex y Claude Code
Solo usamos fuentes publicadas y fechadas, etiquetamos las cifras del fabricante y damos precios de lista en EE. UU. No hicimos pruebas privadas: usa estos datos como base para tu propio piloto.
Coste por tarea y eficiencia de tokens
GPT-6 Astra es la opción puntera más barata por tarea, aunque Claude tiene precios más bajos por token. En la prueba de Vals, Astra cuesta 8,21 $ por tarea frente a 19,07 $ de Opus 5.5: un token barato sale caro si el modelo usa muchos más.
| Por 1M de tokens | Entrada | Caché | Salida | Dónde |
|---|---|---|---|---|
| GPT-6 Astra | 10 $ | Aparte | 50 $ | Codex |
| GPT-6 Sol | 2 $ | 0,20 $ | 10 $ | Codex |
| GPT-6 Luna | 0,10 $ | 0,01 $ | 0,50 $ | Codex |
| Claude Opus 5.5 | 4 $ | 0,20 $ | 20 $ | Claude Code |
| Claude Sonnet 5.5 | 2 $ | 0,20 $ | 10 $ | Claude Code |
Fuentes: OpenAI, OpenAI API, Vellum, Anthropic.
Con los datos de Vals, Astra cuesta unos 0,14 $ por punto y Opus 5.5 unos 0,31 $. Sonnet 5.5 y GPT-6 Sol tienen el mismo precio, pero Sonnet 5.5 obtuvo un 53,03 % frente al 34,34 % de Sol.
El esfuerzo también pesa: Claude Code usa Medium por defecto y GPT-6 Sol ofrece seis niveles. Gartner (2026) prevé que en 2028 el coste de programar con IA superará el salario medio de un desarrollador, según su nota de junio de 2026. Fija el esfuerzo y el enrutado de modelos en tu política.
Precios de Codex vs Claude Code: planes y límites
Los planes de pago son casi idénticos: 20 $ el individual, desde 100 $ el intensivo y 25 $ por puesto de equipo con pago mensual. Codex añade planes gratuito y de 8 $, y publica rangos de mensajes; Claude Code empieza en Pro.
| Nivel | Codex (planes de ChatGPT) | Claude Code (planes de Claude) |
|---|---|---|
| Gratuito | Free: GPT-6 Luna en escritorio, según despliegue | No incluye Claude Code |
| Entrada | Go: 8 $/mes, GPT-6 Luna | No existe |
| Individual | Plus: 20 $/mes, Sol y Luna, revisión de código | Pro: 20 $/mes (17 $ anual) |
| Intensivo | Pro: desde 100 $/mes, 5x o 20x Plus | Max: desde 100 $/mes, 5x o 20x Pro |
| Equipo | Business: 25 $ mensual, 20 $ anual | Team Standard: 25 $ mensual, 20 $ anual |
| Equipo, uso alto | Ampliación con créditos | Team Premium: 125 $ mensual, 100 $ anual |
| Enterprise | Contactar con ventas | 20 $/puesto/mes anual más uso a tarifa de API |
Fuentes: precios de Codex; precios de Claude. Precios de lista en EE. UU., 29 de septiembre de 2026.
OpenAI estima entre 15 y 150 mensajes de GPT-6 Sol cada cinco horas en Plus, sin que sean límites fijos. Anthropic indica multiplicadores de uso, no mensajes.
Flujos de trabajo: CLI, IDE, escritorio y agentes en la nube
Ambos cubren terminal, IDE, escritorio, web, móvil y revisión de pull requests. Codex gira en torno a ChatGPT y a las tareas en la nube; Claude Code, en torno a la terminal y la CI.
| Función | Codex | Claude Code |
|---|---|---|
| Superficies | App de ChatGPT, CLI, IDE, web, iOS | Terminal, VS Code, JetBrains, escritorio, web, móvil |
| Instrucciones | AGENTS.md | CLAUDE.md; también lee AGENTS.md |
| Extensibilidad | MCP, skills, plugins, Codex SDK | MCP, skills, hooks, subagentes, Agent SDK |
| Trabajo en la nube | Tareas cloud, automatizaciones, worktrees | Sesiones cloud, Routines, agentes en segundo plano |
| Revisión de código | @codex review y @codex security review | Code Review para GitHub (Team y Enterprise) |
Fuentes: Codex en GitHub; Codex cloud; Claude Code; Code Review.
Dónde gana Codex
Codex encaja con equipos que lanzan muchas tareas en paralelo sin bloquear sus portátiles. Las tareas cloud se inician desde GitHub, GitLab, Linear o Slack, y @codex security review añade una revisión de seguridad. Además, la CLI de código abierto se puede auditar.
Dónde gana Claude Code
Claude Code encaja con equipos que automatizan en pipelines, con GitHub Actions, GitLab CI/CD, hooks y subagentes. Su Code Review lanza "una flota de agentes especializados" sobre cada pull request, por 15 a 25 $ de media y unos 20 minutos. La comparativa Claude Code vs Cursor cubre su uso en el IDE.
Adopción entre desarrolladores: qué dicen las encuestas
Claude Code lidera la adopción, pero Codex es el que más creció en 2026. Su uso en el trabajo se multiplicó por cinco en seis meses y su notoriedad pasó del 27 % al 65 %.
| Encuesta | Codex | Claude Code |
|---|---|---|
| JetBrains, uso en el trabajo (mayo a julio de 2026, más de 15.000 desarrolladores) | 16 % (3 % en enero) | 39 % (18 % en enero) |
| Pragmatic Engineer (906 encuestados, inicio de 2026) | El 60 % del uso de Cursor | La más usada y "la más querida" (46 %) |
Fuentes: JetBrains Research (agosto de 2026); The Pragmatic Engineer (marzo de 2026).
Según JetBrains (2026), el 31 % de los desarrolladores usa Claude Code como su principal herramienta de IA.
Controles empresariales y gobierno del dato
Los dos ofrecen SSO, SCIM, auditoría y ningún entrenamiento con datos de empresa por defecto. OpenAI suma más certificaciones y regiones de residencia; Anthropic, más vías de despliegue en la nube. La retención cambia según el plan.
| Control | Codex (OpenAI) | Claude Code (Anthropic) |
|---|---|---|
| SSO y SCIM | SSO SAML en Business; SCIM y EKM en Enterprise | SSO en Team; SCIM, auditoría y Compliance API en Enterprise |
| Políticas gestionadas | requirements.toml | Managed settings; puede desactivar el modo auto |
| Entrenamiento con tus datos | No por defecto en Business, Enterprise y API | No con condiciones comerciales |
| Retención | Configurable; retención cero en la API para quien cumpla requisitos | 30 días; retención cero por organización en Enterprise elegible |
| Certificaciones | SOC 2 Type 2, ISO/IEC 27001, 27017, 27018, 27701 | SOC 2 Type 2, ISO 27001 |
| Residencia de datos | 10 regiones, entre ellas EE. UU., Europa y Reino Unido | No figura en la página de precios |
Fuentes: OpenAI, administración de Codex, FAQ de ChatGPT Work, precios de Claude, datos en Claude Code, seguridad de Claude Code.
La retención cero no entra en el plan Enterprise estándar de Anthropic, y Claude Code guarda las transcripciones en local, en texto plano, 30 días. La Compliance Logs Platform de OpenAI conserva datos 30 días, así que expórtalos de forma continua.
Seguridad y gobernanza: cómo usar agentes de código con seguridad
Codex y Claude Code comparten el mismo riesgo: leen contenido no fiable de repositorios, configuraciones, servidores MCP y la web, y actúan con los permisos del desarrollador. Por eso la configuración y los controles en tiempo de ejecución pesan más que la marca.
Sandbox y aprobaciones por defecto
| Control | Codex | Claude Code |
|---|---|---|
| Por defecto en local | Sandbox workspace-write, sin red | Modo auto si no hay modo definido (v2.1.284) |
| Lo más estricto | Sandbox read-only | Modo manual, solo lectura al inicio |
| Lo más arriesgado | danger-full-access, aprobaciones never | bypassPermissions (la organización puede bloquearlo) |
| Aprobación automática | Agente revisor auto_review | Clasificador del modo auto |
| Sandbox del sistema | Seatbelt en macOS, bubblewrap en Linux | Bash aislado en archivos y red |
| En la nube | Contenedores de OpenAI, agente sin red por defecto | VM aisladas; las credenciales de GitHub no entran en la VM |
Fuentes: sandbox de Codex; aprobaciones de Codex; seguridad de Claude Code; changelog de Claude Code.
Revisa tu política ya. Desde la versión 2.1.284, las sesiones de terminal y VS Code de Claude Code arrancan en modo auto si no hay un modo de permisos configurado. Así, un clasificador aprueba casi todo. Además, la verificación de confianza se desactiva en modo no interactivo con -p, el habitual en CI.
Cronología de vulnerabilidades destacadas
| Fecha | Herramienta | Problema | Gravedad | Estado |
|---|---|---|---|---|
| Sep 2025 | Claude Code | Salto del consentimiento en hooks del proyecto | CVSS 8,7 | Corregido en 1.0.87 |
| Oct 2025 | Claude Code | CVE-2025-59536: el proyecto ejecuta código antes del diálogo de confianza | CVSS 8,8 (NVD) | Corregido en 1.0.111 |
| Ene 2026 | Claude Code | CVE-2026-21852: robo de clave de API vía ANTHROPIC_BASE_URL | CVSS 5,3 | Corregido en 2.0.65 |
| Feb 2026 | Codex | Robo de tokens de GitHub por inyección en el nombre de rama | Sin CVE | Parcheado el 5 de febrero |
| Abr 2026 | Codex | CVE-2025-61260: .env y .codex/config.toml ejecutan comandos MCP | CVSS 9,8 | CLI 0.23.0 y anteriores |
| Abr 2026 | Claude Code | CVE-2026-39861: escape del sandbox con enlaces simbólicos | CVSS 10,0 (NVD) | Corregido en 2.1.64 |
| May 2026 | Codex | RCE en Windows vía búsqueda web y node.bat | Sin CVE | OpenAI: "no reproducible" |
| May 2026 | Claude Code | RCE con deeplinks claude-cli:// | Sin CVSS | Corregido en 2.1.118 |
| Sep 2026 | Codex | CVE-2026-19591: salto de aprobación con PowerShell | CVSS 8,8 | CLI 0.72.0 a 0.130.0 |
Fuentes: The Hacker News; The Hacker News; GitHub Advisory; GitLab Advisory; NVD: CVE-2025-59536 y CVE-2026-39861; Cymulate; Strix.
El patrón se repite: configuraciones del proyecto que se ejecutan antes de que nadie apruebe nada. El fallo de los deeplinks, hallado por joernchen de 0day.click, se explica en nuestro análisis del RCE de Claude Code.
Ambos agentes frente a los riesgos de OWASP
OWASP sitúa la prompt injection como LLM01, incluida la que llega desde webs o archivos. El OWASP Top 10 for Agentic Applications clasifica estos incidentes:
- ASI01 Agent Goal Hijack: webs o README envenenados, como en la cadena de Codex en Windows. Consulta nuestra guía de prompt injection indirecta.
- ASI04 Agentic Supply Chain Vulnerabilities: entradas MCP maliciosas en
.codex/config.tomlo.claude/settings.json. Consulta MCP Security 101. - ASI05 Unexpected Code Execution: hooks, saltos de aprobación y escapes del sandbox, como la CVE-2026-19591 y la CVE-2026-39861.
El código generado también exige control: el informe de Veracode 2026 halló un aprobado medio en seguridad del 56 %, casi igual que el año anterior.
Cómo protege NeuralTrust Codex y Claude Code
NeuralTrust añade una única capa de seguridad en tiempo de ejecución para ambos agentes:
- Agent Gateway (TrustGate): enruta el tráfico hacia modelos, servidores MCP y API desde un único punto de políticas, con acceso por identidad y presupuestos. TrustGate incluye más de 200 servidores MCP preconfigurados.
- Agent Runtime Security (TrustGuard): inspecciona prompts, llamadas a herramientas y respuestas en tiempo real para bloquear inyecciones, fugas de secretos y comandos destructivos. Aplica mínimo privilegio frente a la excessive agency.
- AI Red Teaming (TrustTest): pone a prueba tu configuración frente a repositorios y servidores MCP envenenados antes del despliegue.
¿Cuál elegir? Codex o Claude Code
Elige Codex si priorizas el coste por tarea, las tareas en la nube o un cliente abierto. Elige Claude Code por la mejor puntuación independiente, la CI o Google Cloud. Si usas los dos, necesitas una capa de políticas compartida.
| Si eres... | Elige | Por qué |
|---|---|---|
| Un equipo que optimiza el coste por tarea | Codex | GPT-6 Astra: 8,21 $ frente a 19,07 $ por tarea (Vals) |
| Quien busca la mejor puntuación independiente | Claude Code | Opus 5.5: 61,62 % en Terminal-Bench 4.0 (Vals) |
| Un equipo de plataforma que automatiza CI | Claude Code | GitHub Actions, GitLab CI/CD, hooks y Agent SDK |
| Un equipo con muchas tareas en paralelo | Codex | Tareas cloud desde GitHub, GitLab, Linear y Slack |
| Una empresa estandarizada en Google Cloud | Claude Code | Disponible en Google Cloud, Bedrock y Foundry |
| Un CISO que aprueba agentes a escala | Cualquiera, tras un gateway | Una política, una auditoría y control en cada llamada |
Conclusión
La elección Codex vs Claude Code en 2026 está igualada en capacidad y se separa en coste. Claude Opus 5.5 logra la mejor puntuación independiente en Terminal-Bench 4.0, y GPT-6 Astra se queda cerca a menos de la mitad de coste por tarea. Codex aporta plan gratuito, CLI abierta y más certificaciones. Claude Code aporta más adopción, integración con CI y Google Cloud. Ambos corrigieron este año fallos críticos, así que fija aprobaciones y controles en tiempo de ejecución antes de escalar.
Protege Codex y Claude Code en producción con NeuralTrust
Ejecuta Codex, Claude Code o ambos tras una única capa de políticas, con protección en tiempo real para cada prompt, herramienta y conexión MCP.
Comparativas relacionadas
- Claude Code vs. Cursor: comparativa de benchmarks 2026
- Claude vs. ChatGPT: comparativa de benchmarks 2026
Preguntas frecuentes sobre Codex vs Claude Code
1. ¿Es Codex mejor que Claude Code?
Ninguno gana en todo. En Terminal-Bench 4.0 de Vals AI, Claude Opus 5.5 logra un 61,62 % y GPT-6 Astra un 57,07 %, pero Astra cuesta 8,21 $ por tarea frente a 19,07 $. En la clasificación oficial, Codex con Astra (58,2 %) y Claude Code con Fable 5.1 (57,9 %) están dentro del margen de error.
2. ¿Qué es más barato, Codex o Claude Code?
Los precios de lista coinciden: 20 $ el plan individual, desde 100 $ el intensivo y 25 $ por puesto de equipo al mes. Por tarea, GPT-6 Astra sale más barato que Opus 5.5 en los datos independientes (8,21 $ frente a 19,07 $). Por token, Claude es más barato arriba: Opus 5.5 cuesta 4 $/20 $ y Astra 10 $/50 $.
3. ¿Codex es gratis?
En parte. El plan Free de OpenAI incluye GPT-6 Luna en la app de escritorio, según el despliegue, y Go cuesta 8 $ al mes. GPT-6 Sol, la revisión de código y Slack empiezan en Plus, por 20 $. Claude Code no está en el plan Free de Claude: empieza en Pro, por 20 $ al mes.
4. ¿Se pueden usar Codex y Claude Code a la vez?
Sí. Los dos leen AGENTS.md, así que un mismo archivo de instrucciones sirve para ambos. El coste está en la gobernanza: dos agentes suponen dos sistemas de permisos, dos auditorías y dos facturas. Un gateway compartido mantiene políticas y registros coherentes.
5. ¿Qué modelos usan Codex y Claude Code en 2026?
Codex usa GPT-6 Astra, GPT-6 Sol y GPT-6 Luna de OpenAI, y elige un modelo recomendado si no defines ninguno. Claude Code usa modelos de Anthropic, con Claude Opus 5.5 y Claude Sonnet 5.5 como modelos Opus y Sonnet por defecto desde septiembre de 2026.
6. ¿Qué es más seguro para una empresa, Codex o Claude Code?
Ninguno es seguro por defecto. Ambos han corregido fallos críticos explotables desde un repositorio, como la CVE-2025-61260 de Codex (CVSS 9,8) y la CVE-2026-39861 de Claude Code (CVSS 10,0). OpenAI suma más certificaciones. En ambos casos, añade mínimo privilegio, aprobaciones y monitorización en tiempo real.
7. ¿Qué es Terminal-Bench 4.0?
Terminal-Bench 4.0 evalúa agentes de IA en tareas complejas y de varios pasos dentro de la línea de comandos, y hoy es el benchmark que destacan ambos proveedores. La clasificación oficial ordena parejas de agente y modelo, y Vals AI ejecuta todos los modelos con un mismo agente neutral.
Sobre el autor
Roger Howroyd es Head of Global SEO and AI en NeuralTrust, donde lidera la estrategia de búsqueda de la compañía en SEO, AEO, GEO y optimización para LLM. Está especializado en búsqueda impulsada por IA, estrategia de contenidos y SEM. Conecta con él en LinkedIn.
NeuralTrust es la plataforma líder para proteger y escalar agentes de IA. Reconocida como Pioneer en el Gartner Emerging Market Quadrant for AI Application Security 2026, presente en cuatro informes Gartner Hype Cycle de 2026 e incluida en la Gartner Market Guide for Guardian Agents 2026, la Gartner Market Guide for AI Gateways 2025 y el KuppingerCole Leadership Compass for Generative AI Defense 2025. Con sede en Barcelona y oficinas en Londres y Nueva York. Certificada en ISO 27001.
Fuentes
- Anthropic: Claude Sonnet 5.5 (septiembre de 2026)
- Anthropic: Claude Opus 5.5 (septiembre de 2026)
- OpenAI: GPT-6 Astra (septiembre de 2026)
- OpenAI: GPT-6 Sol y Luna (septiembre de 2026)
- API de OpenAI: GPT-6 Sol (septiembre de 2026)
- ChatGPT Learn: changelog de Codex (septiembre de 2026)
- ChatGPT Learn: modelos de Codex (septiembre de 2026)
- ChatGPT Learn: Codex cloud (septiembre de 2026)
- GitHub: openai/codex (septiembre de 2026)
- Claude Code: visión general (septiembre de 2026)
)
)
)