04 · Cómo se mide

Los benchmarks que de verdad importan

Un benchmark es un examen estandarizado: permite comparar modelos, detectar progreso real y elegir herramienta según la tarea. Pero cuando un test se "satura" (todos sacan casi el máximo) deja de discriminar y la industria salta al siguiente. Valores aproximados al 30 de junio de 2026.

Cómo leer un benchmark: mirá tres cosas — qué capacidad mide (código, razonamiento, conocimiento, agencia), qué tan saturado está (si los líderes ya superan ~90%, las diferencias dejan de ser significativas) y si es contaminable (preguntas que pudieron filtrarse al entrenamiento inflan el puntaje). Ningún número aislado define a un modelo.
CódigoSWE-bench VerifiedResolver issues reales de repositorios de GitHub: leer el código, ubicar el bug y proponer el parche. El estándar de facto para capacidad de ingeniería de software.Líderes ~80–88% · alta señal, casi saturado AgentesTerminal-Bench 2.0Tareas reales en una terminal: el modelo encadena comandos, navega el sistema de archivos y completa objetivos de varios pasos. Mide capacidad agéntica end-to-end.GPT-5.5 ≈ 82,7% · benchmark caliente Computer useOSWorld-VerifiedOperar una computadora real con mouse y teclado en apps de escritorio y web. La prueba de fuego para los agentes que "usan la pantalla" como un humano.GPT-5.5 ≈ 78,7% Inteligencia fluidaARC-AGI-2Resolver puzzles visuales nunca vistos a partir de pocos ejemplos. No mide conocimiento memorizado sino capacidad de adaptarse a lo novedoso: lo más cercano a "razonamiento general".GPT-5.5 ≈ 85% · humano promedio 66% Conocimiento expertoHumanity's Last Exam (HLE)2.500 preguntas cerradas escritas por especialistas en matemática, ciencias y humanidades, diseñadas para ser el "examen final" del conocimiento académico. El gran termómetro de lo que falta.Mejor ≈ 44,7% (Gemini 3.1 Pro) · expertos ~90% Razonamiento científicoGPQA DiamondPreguntas nivel doctorado en física, química y biología, "a prueba de Google": no se resuelven buscando, exigen razonar. Mide profundidad científica real.Líderes ~90–92% Matemática fronteraFrontierMathProblemas de matemática de investigación, inéditos y muy difíciles, creados por matemáticos profesionales. Resiste a los modelos donde otros tests ya se saturaron.Aún muy lejos del techo humano SaturadoMMLU / MMLU-ProConocimiento multitarea en 57 materias. Fue EL benchmark de 2020–2023; hoy los modelos frontera se amontonan arriba del 88–90% y ya casi no discrimina. Útil como piso, no como ranking.Saturado > 90% · valor histórico Preferencia humanaLMArena (Chatbot Arena)Votación a ciegas: personas comparan dos respuestas sin saber qué modelo las generó y eligen la mejor. Genera un ranking estilo Elo. La métrica más mirada de "calidad percibida".Ranking en vivo · señal de mercado
Quién puntea a comienzos de julio de 2026: entre los abiertos, GLM-5.2 (Z.ai) lidera el Intelligence Index con ~51, por encima de MiniMax-M3, DeepSeek V4 Pro y Kimi K2.6. En coding agéntico, el sistema de orquestación Fugu Ultra (Sakana) marcó 73,7% en SWE-Bench Pro, por encima de Opus 4.8 (69,2%), GPT-5.5 (58,6%) y Gemini 3.1 Pro (54,2%). El nuevo Grok 4.5 (SpaceXAI, 08/07), orientado a coding, entró 4.º en el Intelligence Index (54) con Terminal-Bench 2.1 83,3% y SWE-Bench Pro 64,7%, a una fracción del costo de Opus. GPT-5.6, ya en disponibilidad general, es el más fuerte de OpenAI en tareas de ciberseguridad.

Los números sin contexto engañan

Para seguir los leaderboards en vivo y comparar precio, velocidad y calidad, pasá por la sección de recursos: LMArena, Artificial Analysis y el Stanford AI Index.