Noticias / OpenAI

OpenAI estrena Ultrafast: GPT 5.6 Sol hasta 14 veces más rápido

Por Joaquín Trapero Publicado hace 4 semanas
OpenAI estrena Ultrafast: GPT 5.6 Sol hasta 14 veces más rápido

Puntos clave

• Ultrafast ejecuta GPT 5.6 Sol hasta 14 veces más rápido que el servicio estándar de la API
• El modo alcanza 750 tokens por segundo sobre los chips de oblea completa de Cerebras
• Cada chip lleva 44 GB de SRAM y guarda los pesos del modelo dentro
• Acceso en pruebas desde el 13 de agosto, con lista de espera y sin precio anunciado

Lo más leído

OpenAI ha presentado Ultrafast, un nuevo modo de su API que ejecuta GPT 5.6 Sol hasta 14 veces más rápido que el servicio estándar y alcanza 750 tokens por segundo, según el anuncio de OpenAI. De momento, acceso limitado: un grupo reducido de clientes lo está probando y el resto pasa por lista de espera.

No hay precio anunciado ni fecha de disponibilidad general. Aun así, el movimiento importa: dibuja hacia dónde va la carrera de modelos cuando la potencia bruta deja de ser el único terreno de juego. La velocidad empieza a venderse como producto.

Qué ha anunciado OpenAI exactamente

Ultrafast se aplica a un único modelo, GPT 5.6 Sol, y convive con el servicio estándar de la API en vez de sustituirlo. OpenAI lo describe como un modo para trabajo sensible al tiempo y cita programación, comercio, análisis financiero y soporte al cliente entre los primeros usos en pruebas.

Las empresas interesadas pueden apuntarse para recibir aviso cuando se amplíe el acceso. Y hay un matiz en el propio anuncio: en tareas de respuesta a incidentes, el criterio y el despliegue siguen siendo responsabilidad del ingeniero. Una respuesta más rápida no traslada la responsabilidad a la máquina.

Cerebras pone el hierro

La velocidad no sale de la infraestructura habitual de OpenAI. Cerebras confirmó el mismo día que Ultrafast corre sobre sus procesadores de oblea completa, chips del tamaño de una oblea de silicio entera con 44 GB de memoria dentro del propio chip. Los pesos del modelo viven en el silicio, sin el cuello de botella de memoria que limita a los GPU, explica la compañía.

Cerebras acompaña el anuncio con cifras propias: 5,6 veces más rápido de punta a punta en el benchmark GDP Val sin perder calidad, 2.500 preguntas de Humanity’s Last Exam resueltas en 11 horas y 11 minutos frente a más de 78 horas de Claude Fable 5, y hasta 11 veces más velocidad de salida que el modelo de Anthropic. Son números del fabricante, no mediciones independientes: tómalos como tarjeta de presentación, no como veredicto.

Qué significa para las empresas españolas

La velocidad cambia qué automatizaciones son viables. Un agente de soporte que responde a 750 tokens por segundo se siente instantáneo en un chat o al teléfono, donde el servicio estándar deja pausas visibles. Informes largos y colas de documentos pasan de tarea de fondo a interacción en vivo, justo el terreno de un chatbot de IA bien montado.

El número que falta es el precio. Sol ya es el modelo caro de OpenAI y un modo premium encima no será barato, así que todavía no hay cuentas que echar. Lo sensato: apuntarse a la lista, medir dónde te cuesta dinero la latencia y repasar Sol, Terra y Luna antes de dar por hecho que el carril rápido compensa.

Qué significa para las empresas españolas

La velocidad es el nuevo tablero

El anuncio coincidió con el lanzamiento de Gemini 3.7 Flash, el caballo de batalla rebajado de Google. Uno compite en coste por token y el otro en tokens por segundo, y los dos apuntan a la misma carga de producción. El hardware especializado llevaba años siendo cosa de nicho; ver a OpenAI montar su modelo estrella sobre obleas completas dice que el nicho se ha hecho mayor.

Scroll al inicio