El 30 de septiembre Google anunció Gemini 4 Argon, su nuevo modelo de frontera (Google, en inglés). Esto es lo que dicen los números publicados, lo que no dicen y cómo prepararse para probarlo con tu propio trabajo.

Dónde lidera

En la tabla de benchmarks que Google publicó con el lanzamiento (Google DeepMind), Argon va por delante en trabajo que la mayoría de las empresas reconocerá: trabajo de conocimiento (Vals Index, 68,9% frente al 67,0% de Claude Opus 5.5), automatización de flujos (AutomationBench, 51,3% frente a 42,5%), agentes financieros (Vals Finance Agent v2, 65,4% frente al 58,9% de Claude Fable 5.1) y agentes legales (benchmark de Harvey, 19,6% frente al 6,7% o menos). También lidera con documentos largos: en GraphWalks, entre 256.000 y 1 millón de tokens, puntúa un 84,2%, frente al 71,8% de GPT-6 Astra. Y puede escribir respuestas mucho más largas, con un límite de salida de 1 millón de tokens, frente a 64.000 antes.

Dónde se queda atrás

La misma tabla muestra a Claude Opus 5.5 por delante en Terminal-bench 4.0 (66,4% frente a 57,4%) y PostTrainBench (49,3% frente a 45,3%), y a GPT-6 Astra por delante en FrontierSWE v2 (65,5% frente a 55,0%), Terminal-Bench Science (68,1% frente a 57,6%) y uso del ordenador con OSWorld-2.0 (72,6% frente a 69,2%). La metodología de Google indica que la mayoría de las puntuaciones de Argon las calculó la propia Google y que la mayoría de las demás son las que publica cada proveedor. La comprobación independiente viene de Artificial Analysis, que sitúa a Argon en 53 en su Intelligence Index, empatado con GPT-6 Astra (Artificial Analysis, en inglés).

Quién puede usarlo, y a qué precio

De momento, la mayoría de los equipos no. Argon llega primero a los equipos de ciberdefensa del Fairwind Program de Google, y después a clientes de pago de la API y a suscriptores de Google AI Ultra, sin fecha. Google da un precio de lanzamiento de 2 $ por millón de tokens de entrada y 10 $ por millón de salida, con la entrada en caché un 95% más barata, que más adelante sube a 4 $ y 20 $. Artificial Analysis calcula que ejecutar su índice cuesta 1,99 $ por tarea con Argon durante el descuento, frente a 3,26 $ con GPT-6 Astra.

Nuestra perspectiva: prepara la prueba antes que el acceso

Una clasificación te dice dónde mirar, no qué cambiar. La preparación útil es la misma que con cualquier modelo nuevo. Elige veinte tareas reales del trabajo en el que Argon dice liderar, como analizar documentos financieros, revisar contratos o responder a partir de archivos muy largos. Escribe cómo es una buena respuesta y pasa ya tu modelo actual por ellas. Cuando Argon llegue a la API, ese mismo conjunto te da una comparación con tu propio trabajo, con el coste por tarea junto a la calidad, en una tarde. Elegir el modelo por trabajo y no por proveedor es el hábito que compensa a medida que siguen llegando modelos de frontera.