Expertos Exponen Fallos en los Benchmarks de IA Basados en Crowdsourcing: ¿Son Válidos los Resultados?

El debate sobre la validez de las evaluaciones colaborativas en IA

Grandes laboratorios como OpenAI, Google y Meta utilizan plataformas de crowdsourcing como Chatbot Arena para evaluar sus modelos de inteligencia artificial. Sin embargo, expertos cuestionan la fiabilidad académica y ética de este método. Gráfico histórico de benchmarks de IA

Problemas de validez y ética

Emily Bender, profesora de lingüística de la Universidad de Washington, señala que estos benchmarks carecen de «validez de constructo»: «No hay evidencia de que preferir una respuesta sobre otra en Chatbot Arena realmente mida capacidades significativas».

El caso Meta: manipulación de resultados

Asmelash Teka Hadgu, cofundador de Lesan, denuncia que Meta ajustó su modelo Llama 4 Maverick para destacar en Chatbot Arena, pero luego lanzó una versión inferior. Comparación de rendimiento de modelos

Propuestas para mejorar las evaluaciones

  • Benchmarks dinámicos: Distribuidos entre entidades independientes (universidades, organizaciones).
  • Compensación justa: Kristine Gloria exige aprender de los errores de la industria de etiquetado de datos.
  • Transparencia: Matt Frederikson (CEO de Gray Swan AI) aboga por combinar evaluaciones públicas con pruebas privadas remuneradas.

Rendimiento de modelos GPT en exámenes

¿Qué dicen los creadores de Chatbot Arena?

Wei-Lin Chiang, de LMArena, defiende su plataforma: «Actualizamos políticas para garantizar evaluaciones justas y reproducibles. El ranking refleja la voz de la comunidad».

Comparte este artículo

Otras notas de tu interés:

Negocios

Google Gemini supera los 1.000 millones de usuarios: Sundar Pichai celebra un nuevo hito

Economia

River AI recauda $1.1 mil millones liderada por General Catalyst para crear agentes de IA personales y entrenables

Economia

Trump y el impuesto pied-à-terre en Nueva York: EE. UU. sopesa frenar la medida

Espectáculos y Entretenimiento

TikTok permitido de nuevo en EE. UU.: la administración Trump impulsa la restauración del servicio

Economia

Brad Lightcap deja OpenAI: el ejecutivo clave anuncia su salida para “empezar algo nuevo”

Espectáculos y Entretenimiento

Spotify lanza los perfiles ‘AI Persona’ y excluirá su música de las recomendaciones

Politica Internacional

Anthropic añade marcas de agua invisibles a Claude para cumplir con el EU AI Act

Economia

El boom del home staging en Miami: cómo el lujo transforma el mercado inmobiliario

Economia

Demócratas, Congreso y criptomonedas: el plan que mira a Wall Street y a los reguladores en EE.UU.

Economia

Laboratorios de IA en EE. UU. desaceleran las pruebas de modelos de alto riesgo