Precios de DeepSeek V4 Flash y Pro: lo que significan de verdad los números
La línea actual de la API de DeepSeek son dos modelos: V4 Flash (`deepseek-v4-flash`, versión DeepSeek-V4-Flash-0731) y V4 Pro (`deepseek-v4-pro`, versión DeepSeek-V4-Pro-0813). Ambos aceptan un contexto de un millón de tokens, ambos limitan la salida a 384K tokens y ambos usan thinking por defecto. La historia comercial es la lista de precios y la nota a pie.
Precios oficiales de lista, por millón de tokens, publicados en la página de precios de DeepSeek el 13 de agosto de 2026:
| Modelo | Entrada con caché | Entrada sin caché | Salida | Concurrencia |
| --- | --- | --- | --- | --- |
| V4 Flash | $0.0028 | $0.14 | $0.28 | 2,500 |
| V4 Pro | $0.003625 | $0.435 | $0.87 | 500 |
La nota no es letra pequeña. DeepSeek dice que planea subir el precio general de la API pronto, "con un aumento significativo esperado." Trata las tarifas de hoy como una ventana, no como un suelo permanente. Si un flujo solo funciona porque Flash cuesta catorce centavos, todavía no funciona.
Flash frente a Pro es una decisión de enrutado, no de marca
Flash es el motor de volumen: 284.000 millones de parámetros, unos 13.000 millones activos. Pro es el insignia: unos 1,6 billones de parámetros, unos 49.000 millones activos. Ambos hablan las formas de API de OpenAI y de Anthropic, ambos hacen JSON, llamadas a herramientas y la Responses API. La compleción FIM es solo en modo no-thinking.
Flash es el valor por defecto para clasificar, extraer, etiquetar, enrutar, redactar y la mayoría de bucles de agente donde el siguiente paso es barato y frecuente. El tope de 2.500 peticiones en concurrencia es la otra razón por la que es el caballo de producción: Pro está en 500.
Pro justifica el dinero extra en el paso difícil: un plan, una revisión, una migración, una decisión donde una respuesta mala sale cara. No es el modelo que pones en cada webhook.
El patrón que funciona es el mismo que usamos en cualquier otra familia: nivel barato por defecto, escalado si la confianza es baja, revisión humana en las decisiones que importan. Elegir un modelo Claude por paso es la misma decisión con otros nombres.
El número que la mayoría de equipos se va a saltar
La entrada con caché cuesta dos o tres décimas de centavo por millón de tokens. Eso es un 98% de descuento frente a un fallo de caché en Flash, y un 99% en Pro.
Si el system prompt, el esquema de herramientas y el contexto recuperado son estables, la mayor parte de la factura de entrada desaparece. Si cada petición manda un bloque recién ensamblado de 20K tokens, pagas el precio de fallo cada vez y la historia de "DeepSeek es barato" se encoge un orden de magnitud.
Por eso tratamos el caché de prompts como una restricción de diseño, no como un ticket de optimización. Controlar el coste de LLM en producción pone primero el tamaño correcto del modelo y segundo el caché; Flash solo hace que la segunda palanca sea inusualmente grande.
Un ejemplo trabajado frente a los otros modelos de esta semana
La misma forma de triaje de soporte que usamos en otros sitios: 6.000 tokens de entrada y 800 de salida por correo, sin caché, 3.000 correos al mes. Precios oficiales de lista a 13 de agosto de 2026. Lee las ratios y luego verifícalo en tus propias trazas.
| Modelo | Coste por correo | Mensual a 3.000 |
| --- | --- | --- |
| DeepSeek V4 Flash | ~$0.00106 | ~$3.20 |
| DeepSeek V4 Pro | ~$0.00331 | ~$9.90 |
| Grok 4.6 (prompt bajo 200K) | ~$0.0168 | ~$50 |
| GPT-5.6 Luna | ~$0.0108 | ~$32 |
| GPT-5.6 Sol | ~$0.054 | ~$162 |
| Claude Opus 5 | ~$0.050 | ~$150 |
Flash es unas 16 veces más barato que Grok 4.6 en esta mezcla, y unas 50 veces más barato que Sol u Opus 5. Eso no es una razón para moverlo todo a Flash. Es una razón para dejar de mandar clasificación y extracción a un modelo frontera.
Grok 4.6 es el otro modelo que salió esta semana. SpaceXAI lo cotiza a $2 de entrada y $6 de salida por millón de tokens por debajo de 200K tokens de prompt, y duplica ambas tarifas cuando el prompt llega a 200K, para toda la petición. El producto alrededor es Grok Bot en x.ai/bot: agentes con su propio ordenador, no otra caja de chat a destajo. Otro trabajo, otra factura.
Lo que esto no cambia
Un token barato sigue siendo un token que no deberías haber gastado. Las transformaciones deterministas, el parseo de fechas, las búsquedas y el mapeo de esquemas van en código normal. Las respuestas repetidas van en una caché o en una tabla de reglas. Un clasificador de alto volumen con etiquetas estables va en un modelo pequeño, o no va en un modelo.
Y un precio tan bajo es una decisión del proveedor, no una ley de la física. DeepSeek ya te ha dicho que el siguiente movimiento es hacia arriba. Construye la capa fina que te deja cambiar el ID del modelo sin reescribir el producto. Esa capa es una semana de trabajo. Volver a preciar todo el flujo porque un proveedor cambió una celda de una tabla es un trimestre.
Si quieres el enrutado y el conjunto de evaluación bien hechos a la primera, una auditoría DX de pago es la forma acotada de hacerlo.
---
Fuentes: DeepSeek Models & Pricing · Anuncio de Grok 4.6 · Docs de modelos de xAI