Guía

Qué modelo de IA elegir: guía de criterios (y por qué el ranking no vale)

Los modelos punteros están empatados en casi todo lo que mide un ranking. Estos son los criterios que sí deciden, y cómo comprobarlos con tus propios casos en una tarde.

Por Javier Giménez Jordana · Actualizada el

La pregunta “¿cuál es el mejor modelo de IA?” no tiene respuesta, y no por diplomacia: es que está mal planteada. Los modelos punteros llevan meses empatados en casi todo lo que mide un ranking, y las diferencias que de verdad notarás no aparecen en esos rankings. Esta guía no te dice cuál es el mejor; te da los criterios para decidir cuál te conviene, y cómo comprobarlo en tu caso en una tarde.

Es una guía viva: los criterios no caducan, pero el mapa de quién es quién lo revisamos cada vez que hay un lanzamiento relevante. La fecha de la última revisión está arriba.

Los seis criterios que deciden de verdad

Ordenados por lo que más suele pesar en la práctica, que casi nunca es el primer puesto de unbenchmark:

  1. Coste por uso real.No el precio por millón de tokens, sino lo que gasta tu tarea concreta. Un modelo “caro” que acierta a la primera puede salir más barato que uno económico que necesita tres intentos y revisión humana.
  2. Ventana de contexto y qué hace con ella.Anunciar un contexto enorme es fácil; mantener la precisión cuando está lleno, no. Si tu caso es “analiza este documento de 200 páginas”, esto pesa más que cualquier otra cosa.
  3. Latencia. Irrelevante para un informe nocturno, decisivo para un chat de atención al cliente o para voz en tiempo real.
  4. Fiabilidad del formato. Si vas a integrarlo en un sistema, importa más que devuelva JSON válido el 100% de las veces que un par de puntos en una prueba de razonamiento.
  5. Licencia y dónde vive. ¿Puedes ejecutarlo en tu propia infraestructura? ¿Los datos salen de la Unión Europea? Para sectores regulados esto no es una preferencia, es un requisito.
  6. Ecosistema. Herramientas, SDK, integraciones, uso de funciones externas. Un modelo ligeramente peor con buen tooling gana a uno mejor al que hay que envolver en código propio.

Elegir por caso de uso

Una forma más útil de decidir: partir de la tarea y ver qué criterio manda.

Si tu caso es…PriorizaY desconfía de…
Atención al cliente por chatLatencia, coste por conversación, control del tonoModelos que se explayan: pagas por cada palabra de más
Programar y refactorizarRazonamiento largo, uso de herramientas, contexto amplioComparativas de código sin ejecutar los tests
Resumir documentación internaPrecisión con contexto lleno, coste por millón de tokensVentanas enormes anunciadas sin datos de precisión
Clasificar o extraer datos a escalaModelos pequeños, salida estructurada fiable, costeUsar el modelo más potente “por si acaso”
Voz en tiempo realLatencia y modelos nativos de audioEncadenar transcripción + texto + voz: se nota el retardo
Datos sensibles o sector reguladoLicencia abierta, despliegue propio, ubicación del datoCualquier ventaja de calidad que te obligue a ceder en esto

Un patrón que se repite y ahorra mucho dinero: usar dos modelos. Uno pequeño y barato para el 90% de los casos, y uno potente al que se escala solo cuando el pequeño no está seguro.

Cómo leer un benchmark sin que te la cuelen

Los gráficos de barras de los lanzamientos son material de marketing. Tres cautelas básicas:

Quién es quién (revisión de agosto de 2026)

El mapa por familias, con nuestra cobertura de cada una para que puedas mirar el detalle:

Deliberadamente no ponemos aquí una tabla de precios y puntuaciones: cambian cada pocas semanas y una cifra desactualizada es peor que ninguna cifra. Para lo que se anuncia cada día, la sección de Modelos de IA; para lo que cuesta usarlos, el análisis del coste real.

La prueba que deberías hacer tú (una tarde)

Ningún ranking sustituye a probarlo con tu trabajo. El método mínimo que funciona:

  1. Reúne 20 casos reales. De tu día a día, incluyendo los difíciles y los raros. No los inventes.
  2. Escribe qué es una buena respuesta para cada uno, antes de ver ninguna salida. Es el paso que la gente se salta y el que hace que la prueba valga.
  3. Pasa los 20 por dos o tres candidatos, con el mismo prompt.
  4. Puntúa a ciegas, sin saber qué modelo produjo cada respuesta.
  5. Calcula el coste de esos 20 casos y multiplícalo por tu volumen mensual.

Con eso tendrás una respuesta mejor que la de cualquier comparativa publicada, incluida esta, porque está medida sobre tu problema. Y guarda esos 20 casos: cuando salga el siguiente modelo, decidir si merece la pena cambiar te costará veinte minutos.

En resumen

Elige por coste real, latencia, fiabilidad de formato y licencia, no por el podio de un gráfico. Combina un modelo barato con uno potente en vez de pagar el más caro para todo. Y monta tu propia prueba de veinte casos: es la única comparativa que responde a tu pregunta.

Otras guías

Boletín

Las noticias de IA que importan, en tu email

Sin ruido. Solo lo más relevante de IA, cada día, en tu email.

Sin spam · Cancela cuando quieras