Fable 5, Opus 4.8 o algo más barato: cómo elegir modelos para flujos de trabajo de IA en producción
Claude Fable 5 se lanzó el 9 de junio de 2026 a $10 por millón de tokens de entrada y $50 por millón de tokens de salida: aproximadamente el doble que Opus 4.8, y muy por encima de los niveles más pequeños sobre los que corre hoy la mayoría de los flujos de trabajo en producción. También es, según Anthropic y los primeros informes de usuarios, un salto real en trabajo complejo y de largo recorrido.
Entonces, ¿qué modelo debería usar tu flujo de trabajo? La pregunta está mal planteada. Los flujos de trabajo de IA en producción son pipelines, y la pregunta útil es: ¿qué modelo debería usar cada paso?
Asigna el modelo al paso, no al flujo de trabajo
Un flujo de trabajo típico de documentos o de soporte tiene pasos con dificultades muy distintas:
Enrutado y etiquetado: clasificar, deduplicar, extraer un ID de cliente. Los modelos pequeños y baratos pasan la evaluación aquí, y el precio de un modelo frontera no aporta nada.
Extracción estructurada y redacción de borradores: extraer campos de documentos, redactar respuestas para revisión humana. Los modelos de gama media suelen pasar; sube de nivel solo si tu set de evaluación dice lo contrario.
Síntesis y juicio: conciliar documentos contradictorios, planificar un cambio en varios pasos, revisar código, investigar entre fuentes. Aquí la capacidad frontera es el cuello de botella, y aquí es donde Fable 5 se gana su precio.
Trabajo autónomo de largo recorrido: migraciones de varios días, investigación dirigida por agentes, refactorizaciones grandes. Esta categoría apenas existía como opción fiable antes de los modelos de clase Mythos; si aparcaste una idea así en 2025, vuelve a probarla.
Un ejemplo de costes con números
Cifras ilustrativas para un flujo de trabajo de triaje de soporte: 1.000 tickets/día, unos 2.000 tokens de entrada y 400 de salida por ticket y por paso.
Todo en Fable 5: unos $0.04 por ticket, aproximadamente $1,200/mes.
Todo en Opus 4.8: alrededor de la mitad, aproximadamente $600/mes.
Pipeline con enrutado: ~85% de los tickets resueltos por completo por un nivel pequeño (normalmente una décima parte del precio frontera o menos), ~15% escalado a Fable 5 para los casos difíciles. Sale por unos $300/mes, con mejor calidad en ese 15% difícil que un montaje todo en gama media.
Los números absolutos son pequeños a este volumen, y esa es la verdadera lección. Con 1.000 elementos/día, la elección de modelo es una decisión de calidad, no de coste. Con 50.000 elementos/día, o con pasos agénticos que consumen cientos de miles de tokens por elemento, el diseño con enrutado es la diferencia entre un flujo de trabajo viable y un incidente de presupuesto. Los tokens de salida dominan a $50 por millón: los pasos agénticos y de salida larga son donde de verdad se concentra el gasto en Fable 5, así que pon tu atención de enrutado ahí, no en las llamadas baratas de clasificación.
El comportamiento de respaldo forma parte de tu arquitectura
Fable 5 no rechaza las peticiones en dominios restringidos (seguridad ofensiva, partes de la biología y la química); en su lugar, responde silenciosamente con Opus 4.8. Anthropic informa de que esto se activa en menos del 5% de las sesiones, y prácticamente nunca en flujos de trabajo de negocio ordinarios. Pero "prácticamente nunca" no es una respuesta de compliance:
Registra el identificador del modelo en cada salida. Quieres poder responder "¿qué produjo esto?" por registro.
Si tu dominio está cerca de un área restringida, incluye casos de la ruta de respaldo en tu set de evaluación, porque parte de tu tráfico está corriendo, en la práctica, sobre otro modelo.
Las evals hacen aburridas las actualizaciones (ese es el objetivo)
Los equipos que lo pasaron mal esta semana son aquellos cuya elección de modelo vive en prompts dispersos sin una batería de pruebas. Los equipos para los que este lanzamiento no fue noticia ejecutan las actualizaciones de modelo igual que las actualizaciones de dependencias:
```
A versioned prompt library
+ an evaluation set built from real (redacted) cases
+ pass/fail acceptance criteria per step
+ CI that runs evals when a prompt or model changes
+ audit logs recording model + prompt version per output
```
Con eso en marcha, "¿deberíamos adoptar Fable 5?" es un experimento de un día: ejecuta las evals, compara el coste por caso aprobado y cambia los pasos donde gana. Sin ello, cada lanzamiento de modelo reabre el debate.
Cuándo no actualizar
El paso ya cumple sus criterios de aceptación con un modelo más barato: la capacidad que no necesitas es solo margen que estás regalando.
Tus contratos asumen condiciones de API sin retención de datos: los modelos de clase Mythos llevan una política obligatoria de retención de 30 días para monitorización de seguridad (consulta nuestra guía de negocio sobre Fable 5 y Mythos 5).
El cuello de botella del flujo de trabajo es la calidad de los datos o el diseño del proceso. El fallo más común que auditamos no es un modelo flojo: es un flujo de trabajo que ningún modelo puede salvar porque las entradas, la propiedad o los pasos de revisión nunca se definieron.
La primera decisión es el alcance, no el modelo
La selección de modelo es un resultado de acotar bien el alcance, no un sustituto de ello. En nuestros sprints de alcance cerrado, la matriz de modelos (qué paso, qué modelo, qué coste por cada mil elementos, qué paso de revisión) forma parte del alcance escrito antes de empezar a construir. Si quieres que esa decisión se tome con datos en la mano en lugar de con entusiasmo de proveedor, empieza con un DX Readiness Audit o un AI Workflow Teardown de 3 días.