Qué modelo de IA elegir: guía de criterios (y por qué el ranking no vale)
Los modelos punteros están empatados en casi todo lo que mide un ranking. Estos son los criterios que sí deciden, y cómo comprobarlos con tus propios casos en una tarde.
Por Javier Giménez Jordana · Actualizada el
La pregunta “¿cuál es el mejor modelo de IA?” no tiene respuesta, y no por diplomacia: es que está mal planteada. Los modelos punteros llevan meses empatados en casi todo lo que mide un ranking, y las diferencias que de verdad notarás no aparecen en esos rankings. Esta guía no te dice cuál es el mejor; te da los criterios para decidir cuál te conviene, y cómo comprobarlo en tu caso en una tarde.
Es una guía viva: los criterios no caducan, pero el mapa de quién es quién lo revisamos cada vez que hay un lanzamiento relevante. La fecha de la última revisión está arriba.
Los seis criterios que deciden de verdad
Ordenados por lo que más suele pesar en la práctica, que casi nunca es el primer puesto de unbenchmark:
- Coste por uso real.No el precio por millón de tokens, sino lo que gasta tu tarea concreta. Un modelo “caro” que acierta a la primera puede salir más barato que uno económico que necesita tres intentos y revisión humana.
- Ventana de contexto y qué hace con ella.Anunciar un contexto enorme es fácil; mantener la precisión cuando está lleno, no. Si tu caso es “analiza este documento de 200 páginas”, esto pesa más que cualquier otra cosa.
- Latencia. Irrelevante para un informe nocturno, decisivo para un chat de atención al cliente o para voz en tiempo real.
- Fiabilidad del formato. Si vas a integrarlo en un sistema, importa más que devuelva JSON válido el 100% de las veces que un par de puntos en una prueba de razonamiento.
- Licencia y dónde vive. ¿Puedes ejecutarlo en tu propia infraestructura? ¿Los datos salen de la Unión Europea? Para sectores regulados esto no es una preferencia, es un requisito.
- Ecosistema. Herramientas, SDK, integraciones, uso de funciones externas. Un modelo ligeramente peor con buen tooling gana a uno mejor al que hay que envolver en código propio.
Elegir por caso de uso
Una forma más útil de decidir: partir de la tarea y ver qué criterio manda.
| Si tu caso es… | Prioriza | Y desconfía de… |
|---|---|---|
| Atención al cliente por chat | Latencia, coste por conversación, control del tono | Modelos que se explayan: pagas por cada palabra de más |
| Programar y refactorizar | Razonamiento largo, uso de herramientas, contexto amplio | Comparativas de código sin ejecutar los tests |
| Resumir documentación interna | Precisión con contexto lleno, coste por millón de tokens | Ventanas enormes anunciadas sin datos de precisión |
| Clasificar o extraer datos a escala | Modelos pequeños, salida estructurada fiable, coste | Usar el modelo más potente “por si acaso” |
| Voz en tiempo real | Latencia y modelos nativos de audio | Encadenar transcripción + texto + voz: se nota el retardo |
| Datos sensibles o sector regulado | Licencia abierta, despliegue propio, ubicación del dato | Cualquier ventaja de calidad que te obligue a ceder en esto |
Un patrón que se repite y ahorra mucho dinero: usar dos modelos. Uno pequeño y barato para el 90% de los casos, y uno potente al que se escala solo cuando el pequeño no está seguro.
Cómo leer un benchmark sin que te la cuelen
Los gráficos de barras de los lanzamientos son material de marketing. Tres cautelas básicas:
- La comparación está elegida. Se publica frente a los rivales donde se gana. Si falta una comparación evidente, esa ausencia es el dato.
- Las pruebas se filtran a los datos de entrenamiento. Cuanto más antiguo y popular es un examen, más probable es que el modelo lo haya visto. Por eso importan más las pruebas nuevas o privadas.
- Las diferencias pequeñas no significan nada. Un par de puntos entre dos modelos punteros no se traduce en ninguna diferencia perceptible en tu trabajo.
Quién es quién (revisión de agosto de 2026)
El mapa por familias, con nuestra cobertura de cada una para que puedas mirar el detalle:
- OpenAI (GPT). El ecosistema más amplio y la integración más directa con producto de consumo. Cobertura reciente: GPT-realtime 2.1 para voz en tiempo real y las novedades de ChatGPT 5.6.
- Anthropic (Claude). Fuerte en tareas largas de programación y en uso agéntico. Ver el análisis de Claude Opus 5 y su uso para crear webs.
- Google (Gemini). Su baza es la integración con el resto de su ecosistema y el trabajo con contextos muy largos y multimodales.
- Pesos abiertos de origen chino. El movimiento más interesante del último año: calidad alta con licencias permisivas, que es justo lo que necesita quien quiere alojar el modelo por su cuenta. Ver Kimi 3 y el open-weight de Alibaba.
- Modelos abiertos occidentales. Menos protagonismo mediático, pero siguen siendo la opción natural cuando el requisito es europeo o el despliegue es propio.
- Combinaciones de varios modelos. Enfoques que enrutan cada consulta al modelo más adecuado en lugar de elegir uno; ver Hermes MoA.
Deliberadamente no ponemos aquí una tabla de precios y puntuaciones: cambian cada pocas semanas y una cifra desactualizada es peor que ninguna cifra. Para lo que se anuncia cada día, la sección de Modelos de IA; para lo que cuesta usarlos, el análisis del coste real.
La prueba que deberías hacer tú (una tarde)
Ningún ranking sustituye a probarlo con tu trabajo. El método mínimo que funciona:
- Reúne 20 casos reales. De tu día a día, incluyendo los difíciles y los raros. No los inventes.
- Escribe qué es una buena respuesta para cada uno, antes de ver ninguna salida. Es el paso que la gente se salta y el que hace que la prueba valga.
- Pasa los 20 por dos o tres candidatos, con el mismo prompt.
- Puntúa a ciegas, sin saber qué modelo produjo cada respuesta.
- Calcula el coste de esos 20 casos y multiplícalo por tu volumen mensual.
Con eso tendrás una respuesta mejor que la de cualquier comparativa publicada, incluida esta, porque está medida sobre tu problema. Y guarda esos 20 casos: cuando salga el siguiente modelo, decidir si merece la pena cambiar te costará veinte minutos.
En resumen
Elige por coste real, latencia, fiabilidad de formato y licencia, no por el podio de un gráfico. Combina un modelo barato con uno potente en vez de pagar el más caro para todo. Y monta tu propia prueba de veinte casos: es la única comparativa que responde a tu pregunta.
Otras guías
- Programar y crear webs con IA: guía práctica con Claude Code
Las prácticas que separan una sesión productiva de una tarde de limpieza, explicadas con Claude Code como ejemplo y aplicables a cualquier agente de programación.
- Automatizar Instagram con IA: qué se puede hacer y qué no
Publicación programada, respuestas a mensajes y gestión de comentarios con IA: lo que funciona, lo que arriesga la cuenta y cómo montarlo sin programar.