Comparativa de modelos · 2026-09-11
Evaluar modelos de lenguaje en español: ODESIA, IberBench y ALIA
Una media global no dice nada sobre cómo se comporta un modelo en español. Qué recursos públicos existen para evaluarlo, cómo montar su propio conjunto de evaluación y por qué no publicamos un ranking.
Una media global no habla de su caso
La mayoría de las cifras que circulan sobre modelos son medias agregadas, y una media agregada mezcla idiomas, dominios y formatos de tarea. Un modelo puede quedar por delante en esa media y comportarse peor que otro en su caso concreto en español.
El desajuste crece cuando el trabajo real no es conversación abierta sino algo acotado: clasificar tickets, extraer campos de una factura, reescribir un texto legal sin cambiar su significado. Ahí la variación entre modelos es mayor que la distancia entre sus medias publicadas.
Los recursos públicos que puede usar
El español tiene, a diferencia de muchos idiomas, infraestructura pública de evaluación. Tres puntos de partida, con sus enlaces, en lugar de una lista de opiniones.
ODESIA, coordinado desde la UNED, publica tablas de resultados sobre tareas discriminativas en español con conjuntos de prueba no divulgados, lo que reduce el riesgo de contaminación por entrenamiento.
IberBench extiende el enfoque a las lenguas ibéricas y a variedades de Iberoamérica, y agrupa decenas de tareas de interés industrial además de las académicas.
ALIA es la infraestructura pública de modelos en castellano y lenguas cooficiales coordinada por el Barcelona Supercomputing Center; su familia de modelos abiertos, incluida Salamandra, es un punto de comparación útil aunque no sea el modelo que acabe usando en producción.
Cómo montar su propio conjunto de evaluación
Nada de lo anterior sustituye a medir sobre sus datos. La buena noticia es que un conjunto útil es más pequeño de lo que la gente cree: entre cincuenta y doscientos casos reales, con la respuesta correcta escrita por alguien que conoce el dominio, ya separa modelos.
- Tome casos reales, incluidos los que hoy fallan; un conjunto solo con casos fáciles no distingue nada.
- Escriba el criterio de acierto antes de ver ninguna salida del modelo.
- Incluya variedad dialectal si su público la tiene: el español de España y el de América no siempre se comportan igual.
- Ejecute todos los candidatos con el mismo prompt y la misma temperatura, a través de una única superficie de API para que la comparación sea limpia.
- Guarde el resultado con fecha y con el identificador exacto del modelo; sin eso no podrá repetir la medición dentro de seis meses.
Lo que no vamos a afirmar
No publicamos una clasificación de qué modelo es mejor en español. No hemos ejecutado esa medición con rigor suficiente para defenderla, y una tabla inventada sería peor que no tener tabla.
Lo que sí ofrece la plataforma es el sustrato para que usted la haga: varios modelos multilingües accesibles con la misma clave y la misma superficie de API, con precios que se mantienen tal y como figuran en el catálogo, de forma que cambiar de candidato no implica reescribir el arnés de evaluación.
Frequently asked questions
¿Los modelos abiertos funcionan bien en español?
Depende de la tarea, y esa es precisamente la razón para medir. Existen modelos abiertos entrenados con atención explícita al español y modelos generalistas que rinden bien sin ese enfoque; la comparación hay que hacerla sobre el caso concreto.
¿Puedo usar ALIA a través de LLMTR?
Los modelos ALIA son un recurso público del proyecto coordinado por el Barcelona Supercomputing Center. Este artículo los cita como punto de comparación; no afirma que estén disponibles en el catálogo de LLMTR.
¿Cuántos casos necesito para que la evaluación sirva?
Con cincuenta casos reales bien elegidos ya se ven diferencias; con doscientos, las diferencias pequeñas dejan de ser ruido. Importa más la calidad de los casos que su número.