Imagen ilustrativa — IA
Volver al blog Back to blog

Gemini 3.8 Live: agentes de voz con IA y razonamiento extendido Gemini 3.8 Live: Google’s AI Voice Agents with Extended Thinking

Google lanzó hoy Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, sus modelos de diálogo en tiempo real más avanzados. Con mejoras en razonamiento paralelo y pensamiento extendido, están diseñados para habilitar agentes de voz capaces de ejecutar tareas complejas en conversación natural. Para equipos de tecnología en Colombia y LATAM que construyen interfaces conversacionales o automatizan procesos con voz, este lanzamiento define un nuevo piso de capacidades disponibles hoy en producción.

Resumen ejecutivo

  • Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026, disponibles en Google AI Studio, la API de Gemini y Vertex AI.
  • Son los modelos de diálogo en tiempo real más avanzados de Google: arquitectura nativa de voz (audio-to-audio), baja latencia y manejo de interrupciones naturales.
  • La variante Extended Thinking incorpora razonamiento paralelo antes de responder, reduciendo errores en tareas complejas sin bloquear el stream de audio.
  • El lanzamiento ocurre mientras Google Cloud crece 82% interanual, con infraestructura de IA como motor principal según resultados de Alphabet de septiembre de 2026.
  • Para Colombia y LATAM: los agentes de voz con IA pueden transformar contact centers, banca y servicios de gobierno, pero exigen cumplimiento de la Ley 1581 de Habeas Data.
  • Riesgo principal: las conversaciones de voz se procesan en servidores de Google; en sectores regulados, usar Vertex AI con control de región es obligatorio.

Qué pasó

El 15 de septiembre de 2026, Google publicó el anuncio oficial de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking en su blog. Los modelos reemplazan la generación anterior de modelos Live y representan, según Google, "la mayor mejora en inteligencia y razonamiento paralelo" de su línea de conversación en tiempo real. El anuncio fue cubierto por Techmeme y llegó a la primera página de Hacker News en pocas horas.

Gemini 3.8 Live está construido para conversación natural fluida: baja latencia, interrupciones sin corte artificial, procesamiento simultáneo de voz y texto. Gemini 3.8 Live Extended Thinking agrega una fase de razonamiento previo a la respuesta final, diseñada para voz en tiempo real. El razonamiento ocurre en paralelo con el stream de entrada, no de forma bloqueante. El usuario puede seguir hablando mientras el modelo "piensa", y el modelo actualiza su razonamiento con información nueva que llegó durante el proceso.

Los modelos están disponibles en Google AI Studio para desarrolladores, la Gemini API vía Google Cloud para producción, y Vertex AI para despliegues empresariales con control de región de datos. Tom Ouyang, responsable del anuncio, describió el objetivo como habilitar "agentes de voz capaces de ejecutar tareas complejas en colaboración con el usuario".

Por qué importa

Los agentes de voz no son un capricho de startups. Son la interfaz natural para millones de personas que no teclean fluido, que usan celulares de gama media con datos limitados, o que interactúan con servicios mientras tienen las manos ocupadas. En Colombia y LATAM, eso describe una fracción significativa de la población activa.

La brecha entre lo que prometían los asistentes de voz de 2021 y lo que entregaban era evidente: respuestas lentas, sin contexto, incapaces de razonar ante preguntas con varias condiciones. Gemini 3.8 Live Extended Thinking ataca ese problema de raíz. El razonamiento paralelo significa que el modelo puede resolver "si tengo este plan de internet y consumo X megas al mes, ¿cuánto pagaré si me paso del límite?" sin necesitar cuatro preguntas de seguimiento y sin silencio incómodo mientras piensa. Para los CTOs que construyen soluciones de atención al cliente, el impacto es directo: menos escalaciones a agente humano, tiempos de resolución más cortos, y conversaciones que no frustran al usuario.

Análisis técnico

Los modelos Live de Gemini operan con arquitectura de streaming audio-to-audio: el audio del usuario entra, el modelo procesa en tiempo real, y el audio de respuesta sale con latencia mínima. No es una cascada de transcripción → LLM → síntesis de voz. Es un pipeline nativo de voz que elimina los saltos de latencia entre etapas. Esa diferencia arquitectónica es la razón por la que la experiencia de conversación se siente más natural.

La versión Extended Thinking introduce razonamiento no bloqueante: mientras el modelo genera la primera parte de la respuesta, ya está procesando el razonamiento para las siguientes. A diferencia de modelos de razonamiento tradicionales donde hay un silencio visible, este proceso es transparente para el usuario. El resultado es una respuesta que llega a tiempo pero con mayor profundidad analítica.

Las integraciones disponibles desde el lanzamiento: Google AI Studio (desarrollo y pruebas), Gemini API vía Google Cloud (producción con autenticación estándar), y Vertex AI (despliegue empresarial con selección de región de procesamiento, SLAs contractuales y audit logs). Para equipos que ya operan en Google Cloud, la ruta natural es Vertex AI porque permite especificar en qué región se procesan las conversaciones de voz.

Impacto para el negocio

El caso de negocio más directo es el contact center. En Colombia, banca, utilities y telecomunicaciones tienen volúmenes de llamadas altos y estructuras de costo intensivas en agentes humanos. Un modelo de agente de voz con razonamiento complejo puede gestionar consultas de nivel 1 y nivel 2 sin escalación, reduciendo el costo por interacción de forma significativa.

Para startups en LATAM que construyen sobre modelos de IA, este lanzamiento cambia el cálculo de arquitectura. Antes, implementar un agente de voz requería integrar STT, LLM y TTS por separado, cada uno con su propia latencia y punto de falla. Ahora el modelo integra ese pipeline. Menos componentes significa menos costo de infraestructura, menos puntos de falla, y menos complejidad de mantenimiento.

Impacto para Colombia y Latinoamérica

Colombia tiene factores estructurales que hacen los agentes de voz con IA particularmente relevantes. El 85% de penetración de smartphones (datos DANE/MinTIC 2025) viene acompañado de planes de datos con límites. Los agentes de voz son más eficientes en consumo de datos que interfaces visuales ricas. Para usuarios en ciudades intermedias o zonas con conectividad limitada, es la interfaz que funciona mejor.

En el sector financiero colombiano, Bancolombia, Davivienda y otros actores tienen presión simultánea de reducir costos operativos y mejorar satisfacción del cliente. Los agentes de voz son una palanca directa para ambos objetivos. Sin embargo, hay una restricción regulatoria no negociable: la Ley 1581 de 2012 (Habeas Data) exige consentimiento explícito para el tratamiento de datos personales. Las grabaciones de voz son datos personales biométricos. Cualquier despliegue debe incluir consentimiento, política de retención, y derecho de supresión claramente documentados.

La Superintendencia de Industria y Comercio (SIC) actualizó sus guías de tratamiento de datos con IA en 2025. Los equipos de legal deben revisarlas antes de ir a producción. El riesgo de sanción por tratamiento indebido de datos de voz es más alto que para texto, porque las grabaciones permiten identificación biométrica del hablante.

Riesgos y trade-offs

  • Soberanía de datos de voz: el procesamiento ocurre en servidores de Google. Para sectores regulados, Vertex AI con región específica es el camino correcto, pero implica costos más altos y mayor complejidad de configuración.
  • Dependencia de proveedor: construir la lógica de negocio de un contact center sobre modelos propietarios de Google genera dependencia real. Si Google depreca el modelo o modifica condiciones de uso, la migración es costosa. Amazon lo demostró con su decisión de deprecar modelos en Bedrock.
  • Alucinaciones en tiempo real: en una llamada de voz, el usuario ya escuchó la información incorrecta antes de que pueda corregirse. Diseñar flujos de validación y escalación a humano no es opcional.
  • Variantes regionales de español: los modelos globales tienden a rendir mejor en español estándar que en variantes colombianas o centroamericanas. Pruebas exhaustivas con usuarios reales son obligatorias antes del despliegue masivo.

Recomendaciones prácticas

  • Prueba Gemini 3.8 Live Extended Thinking en Google AI Studio con casos de uso reales antes de comprometerte con una arquitectura sobre Google Cloud.
  • Si el sector está regulado, usa Vertex AI con región de procesamiento documentada y prepara el flujo de datos para presentarlo a la SIC si lo solicitan.
  • Diseña escalación a agente humano obligatoria para consultas con consecuencias financieras, de salud, o que involucren datos sensibles.
  • Prueba con usuarios nativos de tu variante regional de español. Graba ejemplos reales con el acento y vocabulario de tus usuarios.
  • Compara con alternativas antes de decidir: OpenAI Voice, ElevenLabs + Claude, soluciones híbridas. El mercado de agentes de voz con IA está en movimiento activo.
  • Negocia SLAs de latencia y disponibilidad con Google Cloud si el agente va a producción en un contact center. El 99,9% de uptime mensual permite casi 9 horas de caída; para voz en tiempo real ese número debe ser mucho más alto.

Glosario

  • Live model (modelo en vivo): modelo de IA diseñado para procesamiento de audio en tiempo real con baja latencia, sin cascadas de componentes separados.
  • Extended Thinking (pensamiento extendido): proceso donde el modelo razona internamente antes de generar la respuesta final, mejorando precisión en tareas complejas.
  • Parallel reasoning (razonamiento paralelo): capacidad de procesar múltiples condiciones simultáneamente sin bloquear el stream principal de audio.
  • Vertex AI: plataforma de Google Cloud para despliegue empresarial de modelos de IA con controles de gobernanza, selección de región y SLAs contractuales.
  • Habeas Data: derecho constitucional en Colombia al tratamiento correcto de los datos personales, regulado por la Ley 1581 de 2012.
  • STT / TTS: Speech-to-Text y Text-to-Speech, componentes de transcripción y síntesis de voz en arquitecturas de agentes tradicionales.

Fuentes

Google today launched Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, its most advanced real-time dialogue models to date. With significant improvements in parallel reasoning and extended thinking capability, these models are designed to enable voice agents capable of handling complex tasks in natural conversation. For technology teams in Colombia and Latin America building conversational interfaces or automating processes with voice, this launch raises the baseline of what's possible in production today.

Executive Summary

  • Google launched Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking on September 15, 2026, available via Google AI Studio, the Gemini API, and Vertex AI.
  • These are Google's most advanced real-time dialogue models: native voice architecture (audio-to-audio), low latency, and natural interruption handling.
  • The Extended Thinking variant incorporates parallel reasoning before responding, reducing errors on complex tasks without blocking the audio stream.
  • The launch comes as Google Cloud grows 82% year-over-year, with AI infrastructure as the primary driver per Alphabet's September 2026 results.
  • For Colombia and LATAM: AI voice agents can transform contact centers, banking, and government services, but require compliance with Colombia's Habeas Data Law 1581 of 2012.
  • Main risk: voice conversations are processed on Google servers; for regulated sectors, Vertex AI with data region control is mandatory.

What Happened

On September 15, 2026, Google published the official announcement of Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking on its blog. The models replace the previous generation of Gemini Live models and represent, according to Google, "the biggest upgrade in intelligence and parallel reasoning" in its real-time conversation model line. The announcement was immediately covered by Techmeme and reached the front page of Hacker News within hours.

Gemini 3.8 Live is built for smooth, natural conversation: low latency, natural interruptions without artificial cut-off, and simultaneous handling of voice and text. Gemini 3.8 Live Extended Thinking adds a reasoning phase before delivering the final response — designed for real-time voice. The reasoning occurs in parallel with the input stream, not in a blocking manner. The user can keep speaking while the model is "thinking," and the model updates its reasoning with new information that arrived while processing.

The models are accessible through Google AI Studio for developers, the Gemini API via Google Cloud for production, and Vertex AI for enterprise deployments with data region control. Tom Ouyang, who authored the announcement, described the goal as enabling "voice agents capable of executing complex tasks in collaboration with the user."

Why It Matters

Voice agents are not a startup novelty. They are the natural interface for millions of people who don't type fluently, who use mid-range smartphones with limited data plans, or who interact with services while their hands are occupied. In Colombia and Latin America, this describes a significant fraction of the active population.

The gap between what voice assistants promised in 2021 and what they delivered was visible: slow responses, no context, unable to reason through multi-condition questions. Gemini 3.8 Live Extended Thinking addresses that directly. Parallel reasoning means the model can solve "if I have this data plan and use X gigabytes per month, how much will I pay if I go over the limit?" — without four follow-up questions and without an awkward silence. For CTOs building customer service solutions, the impact is concrete: fewer escalations to human agents, shorter resolution times, and conversations that don't frustrate users.

Technical Analysis

Gemini Live models operate with a native audio-to-audio streaming architecture: user audio comes in, the model processes in real time, and response audio comes out with minimal latency. This is not a transcription → LLM → text-to-speech cascade. It's a native voice pipeline that eliminates latency jumps between stages — the architectural difference that makes the conversational experience feel more natural.

The Extended Thinking version introduces non-blocking parallel reasoning: while the model generates the first part of the response, it's already processing the reasoning for subsequent parts. Unlike traditional reasoning models where there's a visible pause, this process is transparent to the user. The observable result is a response that arrives on time but contains deeper analytical reasoning.

Available integrations from launch: Google AI Studio (development and testing), Gemini API via Google Cloud (production with standard authentication), and Vertex AI (enterprise deployment with data region selection, contractual SLAs, and audit log controls). For teams already operating on Google Cloud, Vertex AI is the natural path because it allows specifying in which Google region voice conversations are processed — critical for meeting data sovereignty requirements.

Business Impact

The most direct business case is the contact center. In Colombia, banking, utilities, and telecommunications have high call volumes and cost structures intensive in human agents. A voice agent model with complex reasoning can handle level 1 and level 2 queries without escalation, reducing cost per interaction significantly.

For LATAM startups building on AI models, this launch changes the architecture calculation. Previously, implementing a voice agent required integrating separate STT, LLM, and TTS components, each with its own latency and failure point. Now the model integrates that pipeline. Fewer components means lower infrastructure cost, fewer failure points, and less maintenance complexity.

Impact for Colombia and Latin America

Colombia has structural factors that make AI voice agents particularly relevant. The 85% smartphone penetration (DANE/MinTIC 2025 data) comes alongside data plans with usage limits. Voice agents are more data-efficient than rich visual interfaces. For users in mid-sized cities or areas with limited connectivity, it's the interface that works best.

In Colombia's financial sector, Bancolombia, Davivienda, and other players face simultaneous pressure to reduce operational costs and improve customer satisfaction. AI voice agents are a direct lever for both objectives. However, there is a non-negotiable regulatory constraint: Law 1581 of 2012 (Habeas Data) requires explicit consent for personal data processing. Voice recordings are biometric personal data. Any deployment must include consent, retention policies, and the right to suppression clearly documented.

The Superintendencia de Industria y Comercio (SIC) updated its AI data processing guidelines in 2025. Legal teams must review these before going to production. The risk of a penalty for improper handling of voice data is higher than for text, because recordings enable biometric identification of the speaker.

Risks and Trade-offs

  • Voice data sovereignty: processing occurs on Google servers. For regulated sectors, Vertex AI with a specific processing region is the correct path — but implies higher costs and greater configuration complexity.
  • Vendor dependency: building contact center business logic on Google's proprietary models creates real dependency. If Google changes pricing, deprecates the model, or modifies usage terms, migration is costly. Amazon demonstrated this with its Bedrock model deprecations.
  • Real-time hallucinations: in a voice call, the user has already heard the incorrect information before it can be corrected. Designing validation flows and human escalation is not optional — it's part of the product.
  • Regional Spanish variants: global models tend to perform better in standard Spanish than in Colombian or Central American variants. Thorough testing with real regional users before mass deployment is mandatory.

Practical Recommendations

  • Test Gemini 3.8 Live Extended Thinking in Google AI Studio with real business use cases before committing to an architecture on Google Cloud.
  • If the sector is regulated, use Vertex AI with documented processing region and prepare data flow documentation to present to the SIC if requested.
  • Design mandatory human escalation for any query with financial or health consequences, or that involves sensitive user data.
  • Test with native speakers of your regional Spanish variant. Record real examples of queries in your users' accent and vocabulary.
  • Compare alternatives before deciding: OpenAI Voice, ElevenLabs + Claude, hybrid solutions. The AI voice agent market is moving fast; today's best model may not be in six months.
  • Negotiate latency and availability SLAs with Google Cloud if the agent goes to production in a contact center. 99.9% monthly uptime allows nearly 9 hours of downtime; for real-time voice, that number must be significantly higher.

Glossary

  • Live model: AI model designed for real-time audio processing with low latency, without cascading separate components.
  • Extended Thinking: process where the model reasons internally before generating the final response, improving accuracy on complex tasks.
  • Parallel reasoning: ability to process multiple conditions simultaneously without blocking the main audio stream.
  • Vertex AI: Google Cloud platform for enterprise AI model deployment with governance controls, region selection, and contractual SLAs.
  • Habeas Data: constitutional right in Colombia to correct and consented handling of personal data, regulated by Law 1581 of 2012.
  • SIC: Superintendencia de Industria y Comercio, Colombia's consumer protection and data authority.
  • STT / TTS: Speech-to-Text and Text-to-Speech, transcription and voice synthesis components in traditional voice agent architectures.

Sources