¿Cuál convence más?
Duelos anónimos votados por usuarios. Mide calidad percibida; no garantiza exactitud factual.
Ver resultados oficialesComparativas de IA
No tienes que saber la palabra benchmark. Aquí encuentras pruebas reales, explicadas sin jerga, para comparar modelos, agentes y sistemas antes de creerles o pagar por ellos.
Cada tarjeta te dice qué se mide y abre el tablero oficial con los resultados.
Duelos anónimos votados por usuarios. Mide calidad percibida; no garantiza exactitud factual.
Ver resultados oficialesStanford HELM reúne escenarios, métricas y modelos con énfasis en transparencia y reproducibilidad.
Explorar resultadosLiveBench actualiza sus preguntas para medir capacidades que no se resuelven repitiendo datos conocidos.
Ver resultados oficialesSWE-bench mide si un agente resuelve incidencias reales dentro de repositorios de software.
Explorar la pruebaARC-AGI evalúa adaptación a problemas novedosos y también muestra el costo por tarea.
Ver resultados oficialesBerkeley BFCL mide si un modelo elige y ejecuta correctamente funciones, APIs y herramientas.
Explorar la pruebaOSWorld prueba agentes en tareas largas dentro de aplicaciones y escritorios reales.
Ver resultados oficialesAider Polyglot comprueba si los modelos editan varios lenguajes y pasan pruebas automáticas.
Explorar resultadosMMMU examina comprensión multimodal y razonamiento experto en múltiples disciplinas.
Ver resultados oficialesMLPerf compara entrenamiento e inferencia bajo reglas comunes de rendimiento.
Explorar resultados