Paulo Vila AI Tier 0: 96.2% | Ahorrado: $148.50 USD
introducción → desarrollo → conclusión

¿Qué modelo usar para qué tarea?

Todos los meses sale un modelo nuevo que dice ser "el mejor". La pregunta que en realidad importa no es esa — es dónde necesitás que viva el dato y qué tan larga es la tarea.

El panorama comercial hoy

Claude ya va por su quinta generación: Haiku 4.5 para lo rápido y barato, Sonnet 5 como el punto de equilibrio calidad/costo, Opus 5 para código agéntico complejo, y Fable 5 en el tope. OpenAI unificó su stack de código bajo GPT-5.6 — Codex ya no es un producto aparte, es el mismo stack con un modo especializado (GPT-5.3-Codex, con variantes Max para trabajo largo y Mini para costo). Gemini juega la carta del contexto: sus variantes 3.1 Pro y 3 Deep Think llegan a ventanas de hasta 1M de tokens, útil cuando necesitás meter un documento entero de una sentada.

Y los locales

Acá es donde este sitio tiene una opinión formada: si la tarea no requiere razonamiento de frontier absoluto, un modelo local resuelve la mayoría del trabajo diario a costo marginal cero. Qwen3.6 27B corre en una o dos GPUs de consumo y tiene 262K de contexto nativo — es lo que corre este mismo sitio.

La matriz real

  • Dato sensible (clientes, contratos, salud): local, sin discusión.
  • Refactor grande o código agéntico de formato largo: Claude Opus o GPT-5.3-Codex-Max.
  • Documentos enormes de una sentada: Gemini, por la ventana de contexto.
  • Todo lo demás — chat, resúmenes, tareas del día a día: el modelo local más barato que resuelva bien.

La trampa más común es usar el modelo más caro "por las dudas" para tareas triviales. La mayoría de lo que hacés todos los días lo resuelve igual de bien un modelo de 8 a 27B corriendo en tu propio hardware.