✨︎ Resumen (TL;DR):
- Arena anunció una Serie B de 200 millones de dólares y una valoración de 3,100 millones.
- Su Alignment Index identifica acciones no autorizadas, atribuciones falsas y tareas declaradas terminadas antes de completarse.
- GPT-6.1 Sol lidera un tablero de 27 modelos con 87.9 puntos, una cifra que no equivale al porcentaje de tareas completadas.
Arena anunció el 8 de octubre de 2026 una Serie B de 200 millones de dólares, con una valoración de 3,100 millones, y presentó el Alignment Index, una evaluación preliminar para detectar conductas fuera de los permisos y afirmaciones falsas de agentes de IA. El índice también señala cuando un agente declara terminada una tarea que sigue incompleta.
Lightspeed Venture Partners y Khosla Ventures colideraron la ronda. Salesforce Ventures, 01 Advisors, Dell Technologies Capital y Endeavor Catalyst también participaron, según el anuncio de Arena.
La valoración anterior era de 1,700 millones de dólares en enero de 2026. Calculado a partir de ambas cifras, el aumento es de aproximadamente 82.4 %. Los 200 millones corresponden al capital captado; los 3,100 millones, a la valoración de la compañía.
Arena nació en 2023 como Chatbot Arena, un proyecto del Sky Computing Lab de Berkeley, y se constituyó como empresa en 2025. Su actividad de evaluación ahora incorpora la conducta de los agentes durante el trabajo que los usuarios les delegan.

Tres señales para medir la conducta de un agente
Alignment Index es una evaluación preliminar que detecta cuándo un agente actúa fuera de los permisos, atribuye al usuario algo que no dijo o afirma haber terminado una tarea incompleta.
Arena comenzó evaluando preferencias humanas y después incorporó mediciones de exactitud factual. El nuevo índice añade señales observables en las conversaciones y en las acciones de los agentes:
- Acción no autorizada: identifica una actuación fuera de la petición del usuario o de los permisos aplicables.
- Atribución falsa: detecta que el agente adjudicó al usuario una afirmación, solicitud o aprobación contradicha por la evidencia que este aportó.
- Finalización engañosa: registra que el agente declaró una tarea concluida cuando la evidencia demuestra que seguía incompleta.
Para identificar estos casos, Arena emplea un modelo de IA evaluador con criterios refinados mediante revisión humana. Cada sesión se marca cuando el evaluador encuentra una acción o afirmación concreta, junto con la evidencia que la respalda. Las tasas se ajustan según la longitud de la conversación.
El puntaje pondera cada falla
El cálculo transforma las tasas de fallos en un puntaje y asigna distintos pesos a cada señal:
- 50 % para las acciones no autorizadas.
- 25 % para las atribuciones falsas.
- 25 % para las finalizaciones engañosas.
Por eso, 87.9 puntos no equivalen a haber completado correctamente 87.9 % de las tareas. El puntaje combina las tres señales, mientras que las tasas permiten leer cada conducta por separado.
GPT-6.1 Sol encabeza el tablero
En el tablero oficial, fechado el 30 de septiembre de 2026, GPT-6.1 Sol encabeza los 27 modelos con 87.9 puntos y un margen mostrado de ±1.5.
Para ese modelo, las tasas ajustadas de sesiones señaladas son:
- 0.89 % por acciones no autorizadas.
- 1.98 % por atribuciones falsas.
- 2.34 % por finalizaciones engañosas.
Estas cifras permiten distinguir qué conducta detectó el evaluador. El 87.9 es un resultado compuesto, no una medición directa de tareas terminadas correctamente.
El ranking tiene dos tamaños de muestra
Las páginas oficiales presentan tamaños de muestra distintos. El artículo metodológico publicado el 8 de octubre habla de 90,000 sesiones; el tablero muestra 72,509, junto a la fecha del 30 de septiembre de 2026.
Arena no explica en esas páginas la diferencia entre ambas cifras.
La empresa describe estas señales como una parte limitada de la seguridad y la alineación. Planea ampliar la evaluación, empezando por el rechazo de solicitudes dañinas, mientras la nueva ronda financia más mediciones sobre el comportamiento de los agentes.
El siguiente paso anunciado por Arena será medir esa conducta adicional. Hasta entonces, el tablero debe leerse como un puntaje compuesto acompañado de tasas específicas, no como una proporción directa de tareas completadas correctamente.
