NeuralTrust ha sido reconocido por Gartner → Leer más
Volver

Gemini 4 Argon: benchmarks, precio y seguridad (2026)

Roger Howroyd 1 de octubre de 2026
Compartir
Gemini 4 Argon: benchmarks, precio y seguridad (2026)

Última actualización: Octubre 2026

¿Qué es Gemini 4 Argon y ya puedes usarlo?

Gemini 4 Argon es el nuevo modelo de frontera de Google DeepMind, anunciado el 30 de septiembre de 2026. Hoy solo está disponible para ciberdefensores de confianza a través del Fairwind Program; los clientes de pago de la API y los suscriptores de Google AI Ultra son los siguientes, sin fecha confirmada, según Google (2026).

Esta guía recoge el acceso, los precios, los benchmarks reportados por el proveedor y los independientes, y las preguntas de seguridad que un CISO debería hacerse antes de aprobar el modelo. Cada cifra lleva fecha y enlace a la página donde aparece.

TL;DR: Puntos clave

  • El acceso es muy limitado. En el lanzamiento, Gemini 4 Argon llegó solo a los ciberdefensores de Fairwind, y DataCamp (2026) no encontró ningún ID de modelo de API publicado el 30 de septiembre.
  • El precio queda por debajo del de sus rivales en el lanzamiento. Google lista 2 $ por millón de tokens de entrada y 10 $ por millón de tokens de salida, que pasan a 4 $ y 20 $, con un 95 % de descuento en la entrada en caché (Google, 2026).
  • La salida es la especificación estrella. El límite de salida es de 1 millón de tokens, frente a 64.000, y Google no ha indicado una ventana de contexto de entrada (MarkTechPost, 2026).
  • Los benchmarks son desiguales. Google reporta un 77,9 % en DeepSWE v1.1 frente al 74,2 % de Claude Opus 5.5, pero Opus 5.5 lidera Terminal-Bench 4.0 con un 66,4 % frente al 57,4 %, y ningún tercero había reproducido la tabla de Google en el lanzamiento (DataCamp, 2026).
  • Los rankings independientes no coinciden. Artificial Analysis puntúa a Argon con 52,6 frente a 57,6 de Opus 5.5, mientras que Vals lo sitúa primero de 41 con un 68,9 % (Trending Topics, 2026; Vals AI, 2026).
  • Las afirmaciones de seguridad hay que comprobarlas. Google dice que Argon lidera el benchmark de inyección de prompts indirecta de Gray Swan, pero no publicó ninguna puntuación, así que las empresas deberían hacer sus propias pruebas.

De un vistazo: Argon frente a Opus 5.5 y GPT-6 Astra

Gemini 4 ArgonClaude Opus 5.5GPT-6 Astra
Anuncio30 sept. 202622 sept. 20263 sept. 2026
Acceso públicoSolo ciberdefensores de FairwindDisponible públicamenteNo verificado aquí
Precio de entrada / salida por 1 M de tokens2 $ / 10 $ inicial, luego 4 $ / 20 $4 $ / 20 $10 $ / 50 $ (VentureBeat)
Límite de salida1 M de tokens128 K tokens128 K tokens
DeepSWE v1.1 (reportado por el proveedor)77,9 %74,2 %74,1 %
Vals Index (reportado por el proveedor)68,9 %67,0 %63,1 %
Terminal-Bench 4.0 (reportado por el proveedor)57,4 %66,4 %58,2 %
Artificial Analysis Intelligence Index52,657,652,7

Fuentes: Google, DataCamp, VentureBeat, Trending Topics, MarkTechPost (límites de salida), NeuralTrust. Consultado el 1 de octubre de 2026.

¿Qué es Argon y quién puede usarlo hoy?

Gemini 4 Argon es un modelo de frontera de Google DeepMind, anunciado el 30 de septiembre de 2026 y lanzado primero para ciberdefensores de confianza a través del Fairwind Program. Google asegura que los clientes de pago de la API y los suscriptores de Google AI Ultra llegarán lo antes posible, y que el modelo participa en el proceso voluntario de revisión previa del Gobierno de EE. UU. (Google, 2026).

Dónde encaja Argon en la familia Gemini

La última serie insignia de Google fue Gemini 3, en noviembre de 2025, según VentureBeat (2026). Fello AI (2026) añade que Argon es el primer Gemini con nombre en clave en lugar de los niveles Pro, Flash y Flash-Lite, y que Google no ha dicho cómo se llamarán los demás modelos de Gemini 4.

Quién tiene acceso ahora mismo

DataCamp (2026) informa de que, el día del lanzamiento, Argon no aparecía en OpenRouter, Vertex AI, Gemini CLI, Cursor ni GitHub Copilot. Los equipos de ingeniería todavía no pueden mover tráfico de producción a este modelo. Los equipos de seguridad son la excepción: Google cuenta que Wiz usó Argon dentro de su iniciativa Scan for Good y encontró una vulnerabilidad crítica en software sanitario que los modelos de frontera anteriores habían pasado por alto.

Precio de Argon: ¿cuánto cuesta frente a Opus 5.5 y GPT-6 Astra?

Durante el periodo introductorio, Gemini 4 Argon cuesta 2 $ por millón de tokens de entrada y 10 $ por millón de tokens de salida. Las tarifas estándar son 4 $ y 20 $, con un 95 % de descuento en la entrada en caché. Google no ha dicho cuánto durará el precio introductorio. Con las tarifas estándar, Argon iguala a Claude Opus 5.5.

ModeloEntrada por 1 M de tokensSalida por 1 M de tokensEntrada en caché por 1 M de tokensCoste de 1 M de entrada + 200 K de salida
Gemini 4 Argon (introductorio)2 $10 $0,10 $4 $
Gemini 4 Argon (estándar)4 $20 $0,20 $8 $
Claude Opus 5.54 $20 $0,20 $8 $
GPT-6 Astra10 $50 $no reportado20 $

Fuentes: Fello AI (precios en caché), VentureBeat (precios de Opus 5.5 y Astra), NeuralTrust. La última columna es un cálculo propio a partir de las tarifas listadas.

El precio de lista es solo una parte de la factura. Según Trending Topics (2026), Artificial Analysis midió un coste por tarea media de 1,99 $ para Argon, 3,26 $ para GPT-6 Astra y 5,98 $ para Claude Opus 5.5. La misma evaluación muestra que Argon consumió 110 millones de tokens para completar el índice frente a una mediana de 82 millones, así que la verbosidad se come parte del ahorro. Artificial Analysis también señala que el precio de Argon es introductorio. DataCamp (2026) añade que Google no ha indicado cómo se facturan los tokens de razonamiento.

Prueba nuestra AI Gateway gratis hoy

Benchmarks de Gemini 4 Argon: lo que reporta Google

Google reporta que Gemini 4 Argon va por delante en DeepSWE v1.1 con un 77,9 %, en el Vals Index con un 68,9 %, en AutomationBench con un 51,3 % y en el Legal Agent Benchmark de Harvey, y por detrás en FrontierSWE v2 y Terminal-Bench 4.0. Son cifras reportadas por el proveedor, y DataCamp (2026) advierte de que ningún tercero las había reproducido en el lanzamiento.

Benchmark (reportado por el proveedor)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
DeepSWE v1.177,9 %74,1 %67,4 %74,2 %
Vals Index68,9 %63,1 %65,8 %67,0 %
Harvey's Legal Agent19,6 %5,4 %6,7 %3,8 %
FrontierSWE v255,0 %65,5 %56,3 %62,3 %
Terminal-Bench 4.057,4 %58,2 %57,9 %66,4 %
CWE-bench v168,0 %68,0 %58,0 %67,0 %
GraphWalks (256K-1M)84,2 %71,8 %65,0 %66,8 %

Fuente: DataCamp (2026), a partir del anuncio de Google. Consultado el 1 de octubre de 2026.

El patrón es concreto. Argon lidera en tareas largas de ingeniería de software, trabajo legal y financiero, recuperación en contexto largo y automatización de procesos. MarkTechPost (2026) reporta un 51,3 % en AutomationBench frente al 42,5 % de Opus 5.5. Se queda atrás cuando el agente trabaja en una terminal o sobre una base de código grande: 10,5 puntos de diferencia con GPT-6 Astra en FrontierSWE v2 y 9 puntos con Opus 5.5 en Terminal-Bench 4.0. Google también reporta un 91,7 % en LVBench, de comprensión de vídeo largo.

Cómo hemos comparado

No hemos ejecutado estos benchmarks. Usamos las cifras reportadas por el proveedor cuando son la única fuente y las etiquetamos como tales. Cuando existe un ranking independiente, lo mostramos junto a la cifra del proveedor. Los precios proceden de los proveedores o de un medio citado, y cada tabla lleva su fecha de consulta.

Qué dicen las evaluaciones independientes sobre Argon

Las evaluaciones independientes sitúan a Gemini 4 Argon en lo más alto de algunos rankings y por detrás de Claude Opus 5.5 en otros. Artificial Analysis lo puntúa con 52,6 frente a 57,6 de Opus 5.5, mientras que Vals lo coloca primero de 41 modelos en su índice, con un 68,9 %. El resumen honesto es un modelo potente y desigual.

Medida independienteGemini 4 ArgonClaude Opus 5.5GPT-6 Astra
Artificial Analysis Intelligence Index52,657,652,7
Coste por tarea media (Artificial Analysis)1,99 $5,98 $3,26 $
Terminal-Bench 4.0 (Artificial Analysis)57,1 %59,6 %59,1 %
Humanity's Last Exam (Artificial Analysis)57,1 %61,4 %54,7 %
Vals Index68,9 %67,0 %no listado
Coste por prueba en Vals15,68 $32,14 $no listado

Fuentes: Trending Topics (2026) para Artificial Analysis, Vals AI (2026). Artificial Analysis solo probó el ajuste High de Argon. Consultado el 1 de octubre de 2026.

The Decoder (2026) reporta una tasa de alucinación del 15 % para Argon frente al 51 % de GPT-6 Astra, pero una precisión factual del 50 % frente al 63 %, y el primer puesto en la Text Arena de Arena.ai con 1.525 puntos. Concluye que Google cierra la brecha sin tomar una ventaja clara. Axios (2026) añade que Bloomberg informó de que parte del personal de Google consideró insuficiente el rendimiento en las pruebas internas, algo que Google rechazó.

Ventana de contexto y límite de salida de 1 M de tokens

Google indica un límite de salida de 1 millón de tokens para Gemini 4 Argon, frente a los 64.000 de los modelos Gemini anteriores, y no indica una ventana de contexto de entrada. Algunos medios hablan de 1 millón de tokens de entrada, pero no hemos podido vincular esa cifra a una fuente de Google, así que considérala sin confirmar.

La cifra de salida es el verdadero diferenciador. MarkTechPost (2026) informa de que Claude Opus 5.5, Claude Fable 5.1 y GPT-6 Astra limitan cada respuesta a 128.000 tokens. Google cita como caso de uso objetivo sus migraciones internas de C y C++ a Rust, de hasta 800.000 líneas, incluido el kernel Zircon de Fuchsia.

Una respuesta de ese tamaño tiene un coste y un riesgo. A 10 $ por millón de tokens de salida, una respuesta máxima cuesta hasta 10 $ con el precio introductorio y 20 $ con el estándar. Más importante aún, un agente que escribe 800.000 líneas de una sola pasada genera un diff que ninguna persona puede revisar línea a línea. El límite de salida eleva lo que está en juego en cada control que rodea al agente.

Seguridad de Gemini 4 Argon: lo que deben saber las empresas

Google reporta que Gemini 4 Argon lidera el benchmark de inyección de prompts indirecta de Gray Swan y que incorpora monitores de cadena de pensamiento y de acciones capaces de detener la ejecución. No publicó ninguna puntuación de inyección, y DataCamp (2026) informa de que el grupo de Fairwind recibió el modelo sin salvaguardas de ciberseguridad. Las defensas del modelo ayudan, pero no sustituyen los controles alrededor del agente.

Qué dice Google que ha incorporado

Google enumera el entrenamiento para rechazar peticiones dañinas, salvaguardas frente al uso indebido en ciberseguridad y CBRN bajo su Frontier Safety Framework, red teaming interno y externo, y monitorización de activaciones para detectar abusos. Añade red teaming automatizado y entrenamiento adversarial contra la inyección de prompts, además de monitores que vigilan el razonamiento y las acciones y pueden detener una ejecución. DataCamp (2026) señala que Google mantuvo los hallazgos de monitorización fuera del entrenamiento para que el modelo no aprenda a esquivarlos.

Riesgos que siguen en manos de quien despliega

Según OWASP (2025), la inyección de prompts es el primer riesgo (LLM01) de su Top 10 para aplicaciones LLM, y la inyección indirecta a través de documentos, páginas web y salidas de herramientas es la variante que llega a los agentes. Además, una afirmación del tipo "lidera el benchmark" es difícil de comparar. El análisis de Opus 5.5 (2026) de NeuralTrust reporta que Opus 5.5 empata con Claude Fable 5.1 en la menor tasa de éxito de inyección en el mismo benchmark de Gray Swan, así que varios proveedores pueden presumir de liderazgo sin puntuaciones publicadas que lo zanjen.

De aquí salen tres exposiciones empresariales. La inyección de prompts puede redirigir a un agente con acceso a herramientas. Los datos pueden filtrarse a través de salidas largas y llamadas a herramientas. Y un agente con permisos de escritura puede actuar sobre un plan erróneo o manipulado a velocidad de máquina. El informe sobre GPT-6 Astra (2026) de NeuralTrust describe el mismo cambio para el modelo de OpenAI, el primero en alcanzar el umbral "Critical" de ciberseguridad de OpenAI. La capacidad cibernética de frontera ya es una característica de todo el mercado, no de un solo proveedor.

Cómo lo aborda NeuralTrust

El control tiene que estar donde actúa el agente, sea cual sea el modelo que haya detrás. Agent Gateway (TrustGate) aplica políticas entre agentes, herramientas y cualquier proveedor de modelos, de modo que cambiar Claude por Gemini no cambia las reglas. Agent Runtime Security (TrustGuard) inspecciona prompts, llamadas a herramientas y salidas en el momento en que ocurren. AI Red Teaming (TrustTest) te permite ejecutar tus propias pruebas de inyección y uso indebido contra Argon antes de aprobarlo, en lugar de fiarte de lo que diga el proveedor. Agent Posture Management (TrustLens) muestra qué agentes y herramientas tienen acceso a qué. NeuralTrust ofrece todo esto como la Runtime Security Mesh y cuenta con cuatro reconocimientos en los Gartner Hype Cycle 2026 en AI Runtime Defense.

¿Cuál deberías elegir?

Elige según lo que puedes desplegar hoy y lo que puedes verificar. Claude Opus 5.5 está disponible ya y lidera el índice independiente. Argon es un candidato sólido para trabajo largo y documental cuando llegue a disponibilidad general. Trata cualquier cambio como una prueba, no como un reemplazo.

Si eres...EligePor qué
Un equipo de seguridad que necesita un modelo en producción este mesClaude Opus 5.5Disponible públicamente y con la mayor puntuación de Artificial Analysis
Un equipo de plataforma con pipelines de alto volumen y sensibles al costeEvalúa Argon cuando haya disponibilidad generalPrecio introductorio más bajo, pero verboso y con precio sujeto a cambios
Un equipo legal o financiero con agentes de investigaciónPrueba Argon primeroLidera el benchmark de Harvey y el Vals Index
Un equipo de ingeniería con agentes de programación en terminalClaude Opus 5.5Lidera Terminal-Bench 4.0 tanto en las cifras del proveedor como en las independientes
Un equipo que planea migraciones de código muy grandesSigue de cerca a ArgonLímite de salida de 1 M, con controles de revisión y reversión
Un ciberdefensor verificadoSolicita acceso al Fairwind ProgramEs la única vía a Argon hoy

Para el detalle de seguridad modelo a modelo, lee nuestro análisis de seguridad empresarial de Claude Opus 5.5 y la guía para CISOs sobre GPT-6 Astra. Para la lista de compra más amplia, consulta la guía para CISOs de seguridad en IA.

Conclusión

Gemini 4 Argon es un modelo de frontera creíble, con ventaja de precio en el lanzamiento, un límite de salida de 1 millón de tokens y buenos resultados en pruebas legales, financieras y de automatización. También es inaccesible para la mayoría de los equipos, no está contrastado fuera de la propia tabla de Google y queda por detrás de Claude Opus 5.5 en el índice independiente. Evalúalo cuando se abra el acceso y pon tus propios controles a su alrededor antes de que toque datos de producción.

Protege Gemini y los agentes de IA multimodelo en producción con NeuralTrust

Ejecuta Gemini, Claude y GPT detrás de una misma capa de políticas y prueba cada modelo contra tus propias amenazas antes de ponerlo en marcha.

Prueba nuestra AI Gateway gratis hoy

Comparativas relacionadas

Preguntas frecuentes sobre Gemini 4 Argon

1. ¿Qué es Gemini 4 Argon?

Gemini 4 Argon es el modelo de frontera de Google DeepMind, anunciado el 30 de septiembre de 2026. Es el primer Gemini con un nombre en clave en lugar de los niveles Pro y Flash. Google lo orienta a programación, trabajo del conocimiento y ciberdefensa, con un límite de salida de 1 millón de tokens y un 95 % de descuento en la entrada en caché (Google, 2026).

2. ¿Está Gemini 4 Argon disponible para el público?

Todavía no. En el lanzamiento solo tenían acceso los ciberdefensores de confianza del Fairwind Program. Google dice que los clientes de pago de la API y los suscriptores de Google AI Ultra son los siguientes, sin dar fecha. DataCamp (2026) no encontró ningún ID de modelo de API publicado ni presencia en OpenRouter, Vertex AI o Cursor el 30 de septiembre.

3. ¿Cuánto cuesta Gemini 4 Argon?

El precio introductorio es de 2 $ por millón de tokens de entrada y 10 $ por millón de tokens de salida. El estándar es de 4 $ y 20 $, y la entrada en caché lleva un 95 % de descuento. Google no ha dicho cuánto durará la tarifa introductoria ni cómo se facturan los tokens de razonamiento, así que presupuesta con la tarifa estándar hasta que lo haga (Google, 2026).

4. ¿Cuál es la ventana de contexto de Gemini 4 Argon?

Google indica un límite de salida de 1 millón de tokens, frente a 64.000, pero no indica una ventana de contexto de entrada en su anuncio. Algunos medios hablan de 1 millón de tokens de entrada, algo que no hemos podido rastrear hasta una fuente de Google. Consulta la documentación del modelo cuando se abra la API antes de diseñar en torno a una cifra (MarkTechPost, 2026).

5. ¿Es Gemini 4 Argon mejor que Claude Opus 5.5?

Depende de la medida. Google reporta a Argon por delante en DeepSWE v1.1 (77,9 % frente a 74,2 %) y en el Vals Index, mientras que Opus 5.5 lidera Terminal-Bench 4.0 y el Artificial Analysis Intelligence Index, 57,6 frente a 52,6. Argon es más barato en el lanzamiento, pero todavía no está ampliamente disponible (Trending Topics, 2026).

6. ¿Es Gemini 4 Argon mejor que GPT-6 Astra?

En la tabla de Google, Argon supera a GPT-6 Astra en DeepSWE v1.1, el Vals Index y Harvey's Legal Agent, y se queda 10,5 puntos por detrás en FrontierSWE v2. Artificial Analysis los valora casi a la par, 52,6 frente a 52,7. El precio introductorio de Argon es una quinta parte del de Astra, según VentureBeat (2026).

7. ¿Es seguro usar Gemini 4 Argon en la empresa?

Google reporta resultados líderes en el benchmark de inyección de prompts indirecta de Gray Swan y describe monitores de razonamiento y de acciones, pero no ha publicado ninguna puntuación. Ningún modelo es a prueba de inyección. Las empresas deberían probar Argon contra sus propias amenazas y aplicar políticas en las capas de gateway y de runtime antes de darle acceso a herramientas (DataCamp, 2026).

8. ¿Qué es el Fairwind Program?

El Fairwind Program es la vía de Google DeepMind para dar acceso anticipado a Gemini 4 Argon a ciberdefensores de confianza. DataCamp (2026) informa de que el grupo de Fairwind recibió el modelo sin sus salvaguardas de ciberseguridad. El anuncio de Google enlaza a la página del programa para más detalles (Fairwind Program).

Sobre el autor

Roger Howroyd es Head of Global SEO and AI en NeuralTrust, donde lidera la estrategia de búsqueda de la compañía en SEO, AEO, GEO y optimización para LLM. Se especializa en búsqueda impulsada por IA, estrategia de contenidos y SEM. Conecta en LinkedIn.

NeuralTrust es la plataforma líder para proteger y escalar agentes de IA. Reconocida como Pioneer en el Gartner Emerging Market Quadrant for AI Application Security 2026, destacada en cuatro informes Gartner Hype Cycle en 2026 y presente en el Gartner Market Guide for Guardian Agents 2026, el Gartner Market Guide for AI Gateways 2025 y el KuppingerCole Leadership Compass for Generative AI Defense 2025. Sede en Barcelona con oficinas en Londres y Nueva York. Certificada ISO 27001.

Fuentes

  1. Google, Gemini 4 Argon: our next era of frontier intelligence, 30 de septiembre de 2026.
  2. DataCamp, Gemini 4 Argon: Benchmarks, Pricing, and Access, 30 de septiembre de 2026.
  3. MarkTechPost, Google DeepMind unveils Gemini 4 Argon with 1M output tokens, 30 de septiembre de 2026.
  4. VentureBeat, Google unveils Gemini 4 Argon, retaking benchmark lead in limited release, 2026.
  5. Trending Topics, Gemini 4 matches GPT-6 Astra but trails Opus 5.5, 2026.
  6. Vals AI, Gemini 4 Argon benchmarks, cost and capabilities, 30 de septiembre de 2026.
  7. The Decoder, Google Gemini 4 Argon closes the gap with OpenAI and Anthropic, 2026.
  8. Axios, Google unveils Gemini 4, 30 de septiembre de 2026.
  9. Fello AI, Gemini 4 Argon: Benchmarks, Price and Who Gets It, 2026.
  10. OWASP, LLM01: Prompt Injection, 2025.

Suscríbete a nuestra newsletter

Compartir

Únete a los líderes que aseguran el ecosistema de agentes

Solicita una demo