Calculadora de costes de OpenAI y Claude API con caché de prompts
Calcular el coste de una funcionalidad de IA solo con los tokens de entrada y salida ya no basta. Los precios actuales de OpenAI y Claude API separan la entrada normal, las escrituras en caché, las lecturas de caché y la salida. Cada categoría tiene una tarifa distinta, así que la forma del tráfico puede importar tanto como el modelo elegido.
Hemos creado una calculadora de costes por tokens de OpenAI y Claude que incluye las cuatro categorías. Elige un modelo, introduce millones de tokens y verás el coste total, el coste de cada tipo y el porcentaje que representa dentro del volumen de tokens.
Los precios se guardan a partir de las páginas oficiales de los proveedores e incluyen una fecha de verificación visible. Es importante porque los modelos, las promociones, los tramos de contexto y las tarifas regionales pueden cambiar.
Los cuatro tipos de tokens de una factura de API
La entrada normal es el contenido del prompt que se procesa sin caché. Incluye mensajes del usuario, instrucciones del sistema, documentos recuperados, definiciones de herramientas e historial de conversación.
Las escrituras en caché son prefijos reutilizables que se guardan para peticiones posteriores. Una escritura puede costar más que la entrada normal, pero puede abaratar todas las peticiones que reutilicen ese mismo prefijo.
Las lecturas de caché son tokens recuperados de una caché de prompts existente. Suelen ser mucho más baratos que la entrada normal. Un system prompt estable, un esquema de herramientas, un conjunto de documentos o un historial largo pueden generar un ahorro importante.
La salida es el texto o razonamiento generado por el modelo. Suele ser la categoría más cara por token, por eso conviene limitar y medir por separado la longitud de las respuestas.
La calculadora mantiene las cuatro categorías separadas. Juntar toda la entrada en una sola cifra oculta si el workflow está pagando contexto repetido o aprovechando la reutilización de caché.
Cómo cambia la estimación con la caché de prompts
La tabla actual de OpenAI separa entrada, entrada en caché, escrituras de caché y salida. Anthropic documenta que una escritura de 5 minutos cuesta 1,25 veces la tarifa base de entrada, una escritura de 1 hora cuesta 2 veces y una lectura cuesta 0,1 veces la entrada base.
Esto plantea una pregunta de diseño sencilla: ¿cuántas veces se reutilizará el mismo prefijo antes de cambiar?
Un asistente de soporte puede reutilizar sus instrucciones y herramientas en cada petición.
Un asistente documental puede reutilizar un manual grande en muchas preguntas.
Un agente puede reutilizar definiciones de herramientas mientras crece su contexto de trabajo.
Un generador de contenido puede tener poca entrada reutilizable y una proporción alta de salida.
La caché no ahorra automáticamente en todos los workflows. Si el prompt cambia en cada petición, el sistema puede seguir pagando escrituras o entrada normal sin conseguir suficientes lecturas baratas. Mide ambos tipos por separado.
Ejemplo con GPT-5.6 Terra
Supongamos este volumen mensual:
5,5 millones de tokens de entrada normal
0,5 millones de tokens de escritura en caché
3 millones de tokens de lectura de caché
1 millón de tokens de salida
Con las tarifas estándar de contexto corto de GPT-5.6 Terra verificadas el 19 de agosto de 2026, el cálculo es:
Entrada normal: 5,5 x 2,50 USD = 13,75 USD
Escrituras en caché: 0,5 x 3,125 USD = 1,5625 USD
Lecturas de caché: 3 x 0,25 USD = 0,75 USD
Salida: 1 x 15,00 USD = 15,00 USD
Total estimado: 31,06 USD
La distribución es un 55% de entrada normal, un 5% de escrituras, un 30% de lecturas y un 10% de salida. Puedes reproducir el ejemplo en la calculadora de costes por tokens y sustituir después las cifras por las tuyas.
Distribuciones orientativas para planificar
No existe una distribución universal para las aplicaciones de IA. La longitud del prompt y la respuesta, la profundidad de la conversación, el diseño RAG, la duración de la caché y la concurrencia cambian el resultado. Estos son puntos de partida ilustrativos, no referencias del sector:
Chat y soporte: 55% de entrada normal, 5% de escrituras, 30% de lecturas y 10% de salida.
RAG y preguntas sobre documentos: 45% de entrada normal, 5% de escrituras, 45% de lecturas y 5% de salida.
Agentes y programación: 50% de entrada normal, 5% de escrituras, 30% de lecturas y 15% de salida.
Generación de contenido: 40% de entrada normal, 5% de escrituras, 10% de lecturas y 45% de salida.
Úsalos para crear un primer presupuesto antes del lanzamiento. Cuando el workflow esté en producción, sustitúyelos por el uso real de las respuestas de la API y tus trazas. Mide por ruta, cliente, tipo de tarea y modelo, no solo con un total de toda la cuenta.
Qué no incluye la calculadora
La herramienta estima las tarifas estándar de tokens de texto de los proveedores. No incluye las escrituras de caché de 1 hora de Anthropic, descuentos por lotes, tramos de contexto largo, procesamiento regional, llamadas a herramientas, imágenes, audio, fine-tuning ni plataformas como Amazon Bedrock.
Estas exclusiones aparecen en la propia herramienta porque una calculadora precisa necesita un límite claro. Si tu workload usa alguno de esos tramos, añádelo como una línea separada del presupuesto.
Calcula el coste de tu OpenAI o Claude API
Abre la calculadora gratuita de OpenAI y Claude API, elige un modelo e introduce los tokens mensuales previstos. El resultado se actualiza al instante y puedes enviarlo por email con el desglose de las cuatro categorías.
Para una estimación de producción, ejecuta primero una muestra representativa. Mide la entrada normal, las escrituras, las lecturas y la salida. Después modela un mes normal y un mes de pico. Así tendrás un presupuesto defendible, no una única cifra optimista.
Fuentes oficiales: Precios de OpenAI API · Precios de Anthropic Claude API