Volver al blog

Revista

Benchmarks de LLMs explicados: MMLU, HumanEval y cómo leerlos

MMLU y HumanEval son los dos benchmarks de LLMs más citados del mundo. Qué mide cada uno, por qué las puntuaciones no son comparables entre proveedores y cómo evitar la trampa más común.

Cada pocos meses llega un nuevo modelo de lenguaje con un comunicado lleno de cifras de benchmark que parecen sacadas de un videojuego: “MMLU 90,3 %, HumanEval 96,2 %, +11 puntos sobre la generación anterior”. Estas cifras se citan por todas partes y casi nunca se explican bien.

Este artículo desglosa los dos benchmarks más citados —MMLU y HumanEval—: qué mide cada uno, por qué los números no son directamente comparables entre proveedores y cómo leer una tabla de benchmarks sin engañarte. Puedes seguir las puntuaciones publicadas de los principales modelos en nuestro dataset de Benchmarks de conocimiento y código de LLMs.

Qué mide realmente MMLU

MMLU (Massive Multitask Language Understanding) es un examen de conocimientos de opción múltiple. Consta de unas 15 000 preguntas sobre 57 materias — desde álgebra abstracta y astronomía hasta derecho, medicina y dilemas morales. Cada pregunta tiene cuatro opciones y el benchmark informa de la precisión del modelo (el porcentaje de respuestas correctas).

Piensa en MMLU como un examen de amplitud de conocimientos con opciones para adivinar. Un baseline aleatorio acierta ~25 % (cuatro opciones); un buen sistema de machine learning de hace una década rondaba el 30 %; los primeros modelos frontera cruzaron el 80–90 % entre 2023 y 2024, y los mejores de hoy se mueven en los 90 bajos — cerca del techo práctico del benchmark tal y como se etiquetó originalmente.

Propiedades clave que recordar:

  • Es conocimiento, no razonamiento. MMLU premia los hechos memorizados y, cada vez más, el reconocimiento de patrones contra el contenido generado por modelos que puebla internet.
  • Es de opción múltiple. La respuesta siempre está presente; la tarea es seleccionar, no generar.
  • Se satura. Cuando los buenos modelos llegan a mediados de los 90, el benchmark deja de distinguirlos — por eso la comunidad se pasó a forks más difíciles como MMLU-Pro.

Qué mide realmente HumanEval

HumanEval es un benchmark de generación de código creado por OpenAI: 164 problemas de programación en Python escritos a mano — firmas de función con docstrings que describen el comportamiento esperado. El modelo debe generar la función completa y la solución se verifica ejecutándola contra tests ocultos.

La métrica publicada es pass@1: la probabilidad de que una única solución generada pase todos los tests. En la práctica, como la generación tiene aleatoriedad, se estima sobre varias muestras.

HumanEval captura lo que la opción múltiple no puede:

  • Importa la fluidez. El modelo debe producir código sintácticamente válido y ejecutable.
  • Importa la semántica. El código debe hacer lo correcto, verificado por ejecución, no por el juicio de un corrector.
  • Importa la subespecificación. Los problemas reales tienen casos límite (entrada vacía, enteros sin límite) que el docstring solo insinúa.

La cara opuesta: con solo 164 problemas, HumanEval es un dataset pequeño y conocido — se filtra en los corpus de entrenamiento y todos los proveedores lo optimizan. Un 90 % de dos empresas diferentes dice menos que el mismo 90 % de dos modelos de hace cinco años. Al envejecer el dataset, la industria se pasó a suites más robustas y difíciles: HumanEval+ (con tests adicionales), LiveCodeBench (problemas held-out con fecha) y SWE-bench (issues reales de GitHub).

MMLU frente a HumanEval: la diferencia real

Dimensión MMLU HumanEval
Modalidad Conocimiento y comprensión del lenguaje Generación de código
Formato Opción múltiple (57 materias, ~15 000 ítems) Síntesis de funciones (164 problemas)
Puntuación % de acierto frente a respuestas etiquetadas pass@1: % que pasa los tests ocultos
Baseline aleatorio ~25 % (4 opciones) ~0 %
Rango frontera (2025–26) ~85–93 % ~85–97 %
Punto débil principal Saturación, memorización Tamaño pequeño, contaminación train/test

Los dos benchmarks miden capacidades ortogonales: uno es “cuánto sabes” y el otro “sabes producir software que funciona”. Un modelo puede ser excelente en MMLU y mediocre en HumanEval, o al revés. Por eso nuestro ranking de LLMs muestra las dos columnas lado a lado en lugar de una puntuación agregada única.

La trampa de los benchmarks: por qué las cifras entre proveedores no son comparables

Esta es la parte que casi nadie lee en las notas al pie, y es la que importa:

  1. Autodeclaradas frente a medidas de forma independiente. La mayoría de las puntuaciones publicadas salen del propio pipeline de evaluación del proveedor. La redacción del prompt, la temperatura de muestreo, el número de intentos y el conjunto exacto de ítems mueven los resultados unos puntos — a veces más.
  2. Contaminación. Los modelos frontera se entrenan con la web abierta y todos los benchmarks populares están en ella. El masivo pero público MMLU se filtra; el pequeño HumanEval se filtra peor.
  3. Deriva de versiones. “MMLU” no es un número único: existe en 5-shot, 0-shot, in-context frente a fine-tuned, forks Pro… y cada variante da un valor distinto.
  4. Efectos techo. Entre el 93 % y el 91 % la diferencia está más cerca del ruido que de un “3 % más inteligente”.

La forma segura de leer cualquier tabla (incluida la nuestra — reportamos las puntuaciones exactamente como se publican, sin re-testear): trata las cifras de los proveedores como cota superior de la capacidad en condiciones favorables, prefiere evaluaciones independientes (ARTEL, HELM, LMArena) cuando necesites comparar, y exige siempre el setup de evaluación junto al número.

Cómo encajan los benchmarks en la matriz de AxioStats

Los benchmarks viven en la celda Tech & IA × Series Temporales & Datos Duros de la matriz: hechos publicados, estructurados, reportados por el proveedor, con metodología explícita. Para explorar:

Más lectura en el blog:

Preguntas frecuentes

¿Qué benchmark es mejor: MMLU o HumanEval? Ninguno — miden cosas distintas. Si te importa la amplitud de conocimientos, MMLU; si te importa producir código que funciona, HumanEval (o mejor, sus sucesores más difíciles como LiveCodeBench o SWE-bench).

¿Por qué HumanEval es tan pequeño? Se diseñó en 2021 como una sonda mínima hecha a mano (164 problemas). Su virtud —escrito por humanos, sin ambigüedad— es también su defecto: no se puede ampliar barato y se filtra en los datos de entrenamiento.

¿Qué puntuación debería tener un buen modelo de código en HumanEval? Superar el 90 % es el mínimo exigible para un modelo de código frontera en 2026. Los benchmarks que discriminan son los más difíciles y de actualización dinámica: HumanEval+ (tests extra), LiveCodeBench (held-out temporal) y SWE-bench (resolución de issues reales).