GPT-6 Astra: dale un encargo que merezca terminar
Viernes, 16:40. Tienes tres ofertas de proveedores, una hoja de cálculo cuyos totales no cuadran y una decisión que debe estar lista el lunes. Ese es el encargo que le daríamos a GPT-6 Astra.
Queremos comprobar hasta dónde llega: localizar la diferencia, contrastar la fuente, preparar una comparativa editable y explicar qué falta por decidir. Un resultado que puedas abrir en la reunión y defender.
Documentación consultada el 5 de septiembre de 2026. La prueba es una propuesta nuestra, no un benchmark realizado ni un resultado de cliente. Portada: ilustración conceptual creada con imagegen.
Astra, en un minuto
OpenAI presenta Astra como su modelo más capaz para trabajo complejo con código, investigación y herramientas profesionales. Se identifica como `gpt-6-astra`, admite 1.050.000 tokens de contexto y hasta 128.000 tokens de salida. Ficha oficial.
Esa ventana permite aportar mucha documentación relevante. Conviene seguir indicando fechas, responsables y qué versión prevalece: meter un archivo desordenado entero en el contexto también mete sus contradicciones.
Dos novedades que se pueden llevar al trabajo
Avanzar mientras llega una consulta. Las llamadas asíncronas permiten que el modelo continúe mientras tu aplicación ejecuta una herramienta. La aplicación sigue encargándose de ejecutarla y devolver el resultado. Documentación de herramientas asíncronas.
En nuestro ejemplo, podría pedir una referencia pendiente y revisar la hoja mientras llega. La conclusión que dependa de esa referencia tiene que esperar. La mejora consiste en aprovechar trabajo independiente sin dar por conocido lo que falta.
Corregir el encargo sobre la marcha. Astra admite nuevas instrucciones durante la respuesta mediante WebSockets en la API Responses. Eso no deshace acciones anteriores ni cancela herramientas que ya se estén ejecutando. Documentación de cambios durante la tarea.
A mitad de la prueba, introduce este cambio: «El proveedor B se ha retirado. Conserva su documentación en el anexo, pero quítalo de la recomendación». Comprueba si actualiza de forma coherente el resumen, los cálculos y la elección final.
Primera misión: dejar preparada la decisión del lunes
Usa datos ficticios o autorizados. Añade una oferta caducada y un total incorrecto a propósito. Define la respuesta correcta antes de empezar.
Puedes reutilizar este encargo:
Objetivo: preparar una comparativa de proveedores para una persona que dispone de diez minutos para decidir.
Material: las ofertas, la hoja y los criterios de compra adjuntos. Los criterios fechados mandan al elaborar la recomendación.
Entrega: comparativa editable, recomendación breve con referencias y preguntas pendientes. Enseña cómo calculas cada total. Señala los datos que no puedas comprobar.
Forma de trabajar: resuelve las decisiones rutinarias y anota los supuestos. Pregunta cuando la respuesta pueda cambiar la recomendación. No envíes mensajes, no compres ni modifiques los originales. Termina indicando qué has verificado y qué sigue pendiente.
El encargo necesita un entorno con las herramientas adecuadas. No presupone que cualquier chat pueda abrir archivos o crear hojas de cálculo. Comprueba primero el acceso al modelo y las funciones de tu cuenta.
Cuánto cuesta ponerlo a prueba
La API estándar cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida. Al superar 272.000 tokens de entrada, toda la petición pasa a las tarifas de contexto largo: 20 y 75 dólares. Precios oficiales.
Ejemplo calculado: 20.000 tokens de entrada sin caché y 5.000 tokens totales de salida facturable suman 0,45 dólares: 0,20 + 0,25. No incluye herramientas, escritura de caché, recargos regionales ni impuestos. La salida facturable incluye razonamiento, no solo el texto que ves. Un encargo puede generar varias peticiones.
Añade el tiempo que dedicas tú: preparar archivos, esperar, corregir y revisar. Si reparar la recomendación cuesta más que hacerla, el precio por token cuenta una parte muy pequeña de la historia.
Puntúa lo que recibiría tu compañero
Fuentes: ¿puedes abrir el documento que respalda cada afirmación relevante?
Cálculos: ¿los totales se reproducen fuera de la respuesta?
Cambios: ¿el proveedor retirado ha desaparecido de todas las recomendaciones?
Entrega: ¿otra persona puede editar y utilizar el archivo?
Pendientes: ¿queda claro qué falta y quién debe resolverlo?
Repite el encargo con tu proceso actual. Prueba después otros ejemplos, incluido uno donde no haya información suficiente para recomendar. Decide qué significa aprobar antes de comparar los resultados.
Si vas a integrarlo, revisa dos condiciones de la guía: Astra no admite razonamiento `none` y las llamadas a herramientas requieren Responses. Guía del modelo.
Nuestro criterio: Astra merece sitio cuando permite terminar un encargo exigente con menos supervisión. Esta prueba te deja una entrega concreta que evaluar el lunes.
¿Tu automatización se queda atascada entre el primer borrador y una entrega útil? Cuéntanos una tarea real. Podemos acotar los datos, las comprobaciones y la integración necesarios para probarla.