Cursónica

Comparativas de IA

¿Qué IA rinde mejor para cada tarea?

No tienes que saber la palabra benchmark. Aquí encuentras pruebas reales, explicadas sin jerga, para comparar modelos, agentes y sistemas antes de creerles o pagar por ellos.

La regla de Cursónica: un primer puesto solo significa que una herramienta rindió mejor bajo esas reglas. No significa que sea la mejor IA para todo.

10 pruebas para no comprar humo

Cada tarjeta te dice qué se mide y abre el tablero oficial con los resultados.

Arena
Preferencia humana

¿Cuál convence más?

Duelos anónimos votados por usuarios. Mide calidad percibida; no garantiza exactitud factual.

Ver resultados oficiales
HELM
Evaluación integral

La prueba más completa

Stanford HELM reúne escenarios, métricas y modelos con énfasis en transparencia y reproducibilidad.

Explorar resultados
LIVE
Preguntas renovadas

¿Responde sin memorizar?

LiveBench actualiza sus preguntas para medir capacidades que no se resuelven repitiendo datos conocidos.

Ver resultados oficiales
SWE
Ingeniería de software

¿Arregla código real?

SWE-bench mide si un agente resuelve incidencias reales dentro de repositorios de software.

Explorar la prueba
ARC
Razonamiento adaptable

¿Resuelve lo que nunca vio?

ARC-AGI evalúa adaptación a problemas novedosos y también muestra el costo por tarea.

Ver resultados oficiales
BFCL
Herramientas y agentes

¿Sabe usar herramientas?

Berkeley BFCL mide si un modelo elige y ejecuta correctamente funciones, APIs y herramientas.

Explorar la prueba
OS
Uso del computador

¿Puede manejar tu computador?

OSWorld prueba agentes en tareas largas dentro de aplicaciones y escritorios reales.

Ver resultados oficiales
Aider
Edición de código

¿Edita código sin romperlo?

Aider Polyglot comprueba si los modelos editan varios lenguajes y pasan pruebas automáticas.

Explorar resultados
MMMU
Texto más imagen

¿Entiende texto e imágenes?

MMMU examina comprensión multimodal y razonamiento experto en múltiples disciplinas.

Ver resultados oficiales
MLPerf
Infraestructura

¿Qué tan rápido trabaja?

MLPerf compara entrenamiento e inferencia bajo reglas comunes de rendimiento.

Explorar resultados

Una puntuación no te cuenta toda la historia

  • El resultado puede depender del prompt, costo, tiempo de razonamiento o sistema que rodea al modelo.
  • Una prueba de código no mide creatividad; una votación humana no garantiza verdad.
  • Elige la comparativa más cercana a la tarea que realmente necesitas resolver.