Evaluacion de LLMs en la web

Enlaces a plataformas publicas donde se comparan, rankean o evaluan modelos de lenguaje. Cada sitio abre en una pestaña nueva.

10 sitio(s) disponible(s).

Leaderboard / ranking

vellum LLM Leaderboard

Leaderboard / ranking

Es un Enfoque de Pruebas Académicas Open LLM Leaderboard: Gestionado por la comunidad en Hugging Face, este tablero se especializa exclusivamente en modelos de código abierto u open-weights

https://www.vellum.ai/llm-leaderboard

Open LLM Leaderboard

Leaderboard / ranking

Ranking de modelos abiertos en benchmarks academicos (MMLU, GSM8K, etc.).

https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard

Kilo

Leaderboard / ranking

Kilo AI Coding Leaderboard: permite saber IA es la mejor programando, esta plataforma mide el rendimiento real de los modelos en entornos de desarrollo (workflows de código, planificación y depuración de errores).

https://kilo.ai/leaderboard

Benchmark

HELM (Stanford)

Benchmark

Holistic Evaluation of Language Models: bateria amplia de tareas y metricas.

https://crfm.stanford.edu/helm/

LiveBench

Benchmark

Benchmark actualizado con preguntas nuevas para reducir memorizacion del entrenamiento.

https://livebench.ai/

LLM Stats

Benchmark

Plataforma de análisis comparativo diseñada para ayudar a los usuarios a evaluar y seleccionar modelos lingüísticos de gran tamaño en función de métricas de rendimiento, estructuras de precios y capacidades técnicas.

https://llm-stats.com/

Arena Leaderboard

Benchmark

Tabla de clasificación oficial y más respetada a nivel mundial para evaluar modelos de Inteligencia Artificia ¿Cómo funciona y por qué es tan importante?Votación a ciegas (Batallas): Los usuarios entran a la plataforma web e introducen cualquier pregunta o comando (prompt). Dos modelos de IA anónimos (por ejemplo, GPT-4 y Claude 3.5) responden al mismo tiempo. El usuario vota cuál dio la mejor respuesta sin saber qué IA la generó.Sistema de puntuación Elo: Al igual que en el ajedrez o en los videojuegos competitivos, las victorias y derrotas de cada IA calculan su puntuación "Elo" en tiempo real.Estándar de la industria: Se considera el termómetro más confiable y transparente del sector porque se basa en preferencias humanas reales (crowdsourcing), evitando que las empresas de IA hagan "trampa" adaptando sus modelos solo para aprobar exámenes o pruebas técnicas estáticas.

https://huggingface.co/spaces/lmarena-ai/arena-leaderboard

Herramienta de evaluacion

Artificial Analysis

Herramienta de evaluacion

Comparativa de latencia, precio y calidad entre proveedores y modelos.

https://artificialanalysis.ai/

OpenRouter Models

Herramienta de evaluacion

Catalogo de modelos disponibles, precios y contexto maximo por proveedor.

https://openrouter.ai/models

Documentacion / guia

Papers With Code — LLM

Documentacion / guia

Estado del arte y papers recientes en modelado de lenguaje.

https://paperswithcode.com/task/language-modelling