Tech & IA · Telemetría en vivo
Benchmarks de conocimiento y código de LLMs
Puntuaciones publicadas de MMLU y HumanEval de los principales modelos de lenguaje, según cada proveedor. No re-medidas de forma independiente.
Integrar
Incorpora esta página de datos en cualquier sitio con un iframe.
<iframe src="https://axiostats.com/es/datasets/llm-leaderboard/" title="AxioStats — Benchmarks de conocimiento y código de LLMs" width="100%" height="480" loading="lazy"></iframe>
Endpoint de API
Los mismos datos que esta página, servidos como JSON estático — sin clave.
curl https://axiostats.com/api/datasets/llm-leaderboard.jsonhttps://axiostats.com/api/datasets/llm-leaderboard.json
Resumen ejecutivo
LLM Knowledge & Coding Benchmarks: GPT-4o encabeza la tabla con 88.7 puntos de MMLU, seguido de Claude 3.5 Sonnet (88.7). La horquilla entre el primero y el último (Mistral Large 2, 84) es de 4.7 puntos.
Los resultados son los publicados por cada proveedor en sus informes (no re-medidos). MMLU mide precisión de conocimiento; HumanEval, generación de código. Consulta la fila 'source' de la tabla para la referencia exacta.
Datos
| Modelo | MMLU | HumanEval | Fuente |
|---|---|---|---|
| GPT-4o | 88.7 | 90.2 | OpenAI GPT-4o report |
| Claude 3.5 Sonnet | 88.7 | 92 | Anthropic announcement |
| Llama 3.1 405B | 88.6 | 89 | Meta Llama 3.1 blog |
| DeepSeek-V3 | 88.5 | 82.6 | DeepSeek-V3 report |
| Gemini 1.5 Pro | 85.9 | 84.1 | Gemini 1.5 report |
| Mistral Large 2 | 84 | 81.1 | Mistral announcement |