Google ha lanzado dos modelos que no se escriben: se hablan. Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking salieron para desarrolladores el mismo día del anuncio, y los dos están pensados para conversaciones en voz alta, en tiempo real y con una persona al otro lado.
La voz llevaba meses siendo el terreno donde OpenAI y Anthropic marcaban el paso y Google respondía. Esta vez el orden cambia: en el índice independiente de calidad de voz, el modelo con razonamiento ampliado se ha puesto primero, según el anuncio de Google.
Qué hacen los dos modelos
La diferencia entre ellos es coste contra profundidad. Gemini 3.8 Live es el de volumen, pensado para escalar barato, y Google lo describe como conversación fluida más comprensión visual. Extended Thinking es el del trabajo duro: razona en varios pasos y lo hace mientras habla, sin ese silencio incómodo mientras piensa.
Los dos aceptan imagen en tiempo real, así que quien llama puede enfocar con la cámara una pieza rota o la lectura de un contador y seguir hablando. Y los dos ejecutan tareas de fondo sin cortar la conversación: la diferencia entre un asistente que te deja en espera y uno que sigue charlando mientras consulta.

Dónde queda frente a sus rivales
En el Speech to Speech Quality Index de Artificial Analysis, Extended Thinking sacó 82,6 y se llevó el primer puesto. El hermano barato quedó segundo en Speech Agent Arena. Son los dos resultados con los que Google abrió el anuncio.
Los números de agente dicen más para una empresa. Extended Thinking completó el 68,6% de las tareas del benchmark tau Voice y el 35,1% en la prueba de banca de Sierra. En razonamiento sobre audio, 97,7% en Big Bench Audio. Ojo con esa distancia: un agente que despacha la mayoría de las llamadas todavía se atraganta con lo regulado.
Una cautela: esas cifras salen del propio anuncio, incluidos los puestos en tablas ajenas. El índice de Artificial Analysis se comprueba aparte; el resto, mejor verificarlo antes.
Qué significa para las empresas españolas
Lo primero que viene a la cabeza es el teléfono. España vive en buena parte de atender a gente que llega de fuera, y un modelo que se maneja en 97 idiomas y nota el cambio a media frase encaja aquí mejor que en casi ningún otro mercado.
La pieza que de verdad hay que probar es la de las tareas en segundo plano. Un agente que consulta una reserva o mira el stock mientras sigue hablando se come los silencios que hacen colgar a la gente. Eso está bastante más cerca de servir que la generación anterior de chatbots con IA, que tenía que elegir entre escuchar o hacer.
Y la pega. Un agente de voz en directo oye todo lo que dice quien llama, incluido lo que nadie pretendía darle, y el RGPD trata esa grabación igual que trataría un formulario. Antes de preguntarse si el modelo suena bien, hay que saber dónde va el audio y cuánto se queda.
Dónde está la letra pequeña
Google no ha publicado precios, ni identificadores de modelo, ni ventana de contexto, ni una sola cifra de latencia. Para quien tenga que presupuestar una centralita con esto, ahí está el agujero: los benchmarks dicen que el modelo es bueno y no dicen si sale a cuenta.
De momento se toca en la API de Gemini y en Google AI Studio. Para empresa, Gemini Enterprise lo tiene en vista previa privada. Y de cara al público está en Search Live y en Gemini Live para quien pague Pro o Ultra.
Una carrera que cambia de terreno
Lo llamativo no es que Google se haya puesto al día, sino que ha partido la gama por coste y no por capacidad. Espera volumen: que el barato haga casi todo y el caro entre solo cuando la cosa se complica.
Para comparar a los tres grandes en lo demás, la foto no ha cambiado esta semana: nuestra comparativa de Claude y Gemini sigue valiendo para el trabajo escrito. La voz es, ahora, el eje donde se separan.
