Ir al contenido

Traducción en vivo con Gemini Live API y LiveKit

18 de agosto de 2026 por
Traducción en vivo con Gemini Live API y LiveKit
ContentFlow

Traducción simultánea en vivo con Gemini Live API y LiveKit: así funciona por dentro

Imagina organizar un webinar donde cada participante escucha al ponente en su propio idioma, en tiempo real, sin intérpretes humanos ni infraestructura costosa. No es ciencia ficción: es exactamente lo que el equipo de Google for Developers acaba de publicar como demo open source, y el código está disponible para que cualquier equipo de desarrollo lo adapte a sus propios proyectos.

El sistema combina el nuevo modelo Gemini 2.5 Live Translate, disponible vía la Gemini API, con LiveKit como capa de distribución de audio en tiempo real. El resultado es una aplicación que puede transmitir la voz de un ponente traducida simultáneamente a decenas de idiomas, con los oyentes eligiendo su preferencia desde el navegador o el celular.

En este artículo analizamos cómo está construida esta arquitectura, cuáles son sus decisiones de diseño más inteligentes, y qué implicaciones tiene para equipos de desarrollo y empresas en Perú y América Latina que quieran eliminar barreras de idioma en sus comunicaciones.

La arquitectura: una sesión por idioma, no por oyente

El insight más importante de este proyecto no está en el modelo de IA — está en cómo se gestiona la eficiencia del sistema. El equipo resolvió un problema clásico de escalabilidad con una decisión muy limpia: se abre una sola sesión de traducción por idioma solicitado, sin importar cuántos oyentes quieran escuchar en ese idioma.

Si cien personas quieren escuchar en portugués, el sistema abre una única conexión WebSocket con la Gemini API para portugués y distribuye ese mismo stream traducido a todos los cien oyentes a través de LiveKit. Cuando el último oyente de ese idioma se desconecta, la sesión se cierra automáticamente. Esto reduce dramáticamente el costo de llamadas a la API y el consumo de CPU.

El audio del ponente llega como datos PCM en bruto desde la página de transmisión hacia la sala de LiveKit. Desde ahí, el Translation Bridge — el componente central de la aplicación — detecta qué idiomas están siendo solicitados, abre las sesiones correspondientes con Gemini Live Translate, y publica tanto el audio traducido como las transcripciones en tiempo real a los participantes suscritos. Las transcripciones se muestran de forma incremental: aparecen mientras el modelo habla y se consolidan en párrafo completo cuando el segmento finaliza.

El stack técnico y sus decisiones de diseño honestas

La aplicación está construida con Next.js desplegado en Google Cloud Run, lo que permite mantener WebSockets de larga duración activos sin necesidad de servidores dedicados. Cuando no hay tráfico, Cloud Run puede escalar a cero instancias, lo que significa que el costo en momentos de inactividad es literalmente cero.

Para la distribución de audio se usa WebRTC, y LiveKit actúa como el servidor de señalización y relay. LiveKit ofrece una solución cloud lista para usar con cuenta gratuita para empezar, aunque también puede desplegarse de forma self-hosted al ser open source. Las claves de API y los secretos se gestionan a través de Google Secret Manager, integrado directamente en el proceso de deploy.

Lo que más valoro de este proyecto es la honestidad de sus autores sobre las limitaciones. El estado del sistema — qué idiomas están activos, qué sesiones existen — se guarda en memoria. Eso significa que por ahora la aplicación solo puede correr en una instancia máxima. Si se quisiera escalar horizontalmente, habría que mover esa gestión de estado a una base de datos externa. El readme lo dice sin rodeos, y eso es exactamente el tipo de transparencia que hace útil un proyecto open source.

En términos de capacidad, el sistema funciona bien con 15 a 20 idiomas simultáneos y entre 200 y 300 oyentes activos en LiveKit Cloud. Si se necesitara escalar más allá de eso, la solución propuesta es separar cada idioma en salas independientes de LiveKit, lo que permitiría escalar de forma indefinida.

¿Cómo aplica esto en empresas de Perú y América Latina?

La barrera del idioma sigue siendo un obstáculo real en muchos contextos empresariales de la región. Capacitaciones corporativas con equipos en varios países, eventos de socios comerciales con audiencias mixtas, conferencias académicas, o incluso reuniones internas en empresas con operaciones en Brasil y el resto de Latinoamérica son casos donde esta tecnología tiene aplicación directa.

Hasta hace poco, ofrecer traducción simultánea en un evento virtual requería contratar intérpretes humanos o pagar licencias de plataformas especializadas con costos elevados. Con esta arquitectura, un equipo de desarrollo con conocimientos en Next.js y acceso a la Gemini API puede construir una solución personalizada, integrada a sus propias plataformas, en un tiempo razonable.

Para empresas que ya usan herramientas como Odoo para gestionar sus operaciones, esto abre la posibilidad de integrar traducción en vivo en módulos de capacitación interna, en eventos de lanzamiento de productos, o en sesiones de soporte técnico con clientes de distintos países. El costo de la API de Gemini por sesión es significativamente menor que el de un intérprete profesional por hora.

¿Cómo aplica esto en tu empresa?

Si estás evaluando implementar algo similar, estos son los pasos concretos para empezar:

  • Clona el repositorio open source del demo desde la cuenta de GitHub de Google Gemini y revisa el readme completo antes de tocar código.
  • Crea una cuenta gratuita en LiveKit Cloud para obtener tus credenciales de API. Es la forma más rápida de tener el entorno listo sin configurar infraestructura propia.
  • Obtén acceso a la Gemini API desde Google AI Studio y habilita el modelo Gemini 2.5 Live Translate en tu proyecto.
  • Despliega en Google Cloud Run siguiendo el comando del readme. El proceso está documentado paso a paso y usa Docker para garantizar consistencia entre entornos.
  • Define tus límites de escala desde el inicio: si tu caso de uso requiere más de 20 idiomas simultáneos o más de 300 oyentes, planifica desde ya la migración del estado a una base de datos externa.

Si tu equipo de desarrollo no tiene experiencia previa con WebRTC, WebSockets de larga duración o el ecosistema de Google Cloud, este proyecto puede ser más complejo de lo que parece a primera vista. En ese caso, tiene sentido contar con asesoría técnica que ayude a evaluar si esta arquitectura se adapta a tus necesidades específicas o si hay alternativas más simples para tu caso.

Conclusión

El demo de traducción en vivo con Gemini Live API y LiveKit es un ejemplo concreto de cómo la IA generativa está dejando de ser una tecnología de laboratorio para convertirse en infraestructura real de comunicación. La decisión de publicarlo como open source, con documentación honesta sobre sus limitaciones, lo hace especialmente valioso para equipos que quieren aprender o construir sobre él.

La pregunta que queda sobre la mesa no es si esta tecnología funciona — claramente funciona. La pregunta es qué tan rápido las empresas de la región van a incorporarla antes de que se convierta en un estándar esperado en cualquier evento o capacitación.

En Consultoría-Ti trabajamos con empresas en Perú y América Latina para evaluar, diseñar e implementar soluciones tecnológicas que resuelvan problemas reales de negocio. Si te interesa explorar cómo una arquitectura como esta podría integrarse en tus operaciones, conversemos sin compromiso.

Fuentes y Referencias

Google for Developers — Build a live translation broadcast app with the Gemini Live API and LiveKit



✨ Contenido generado con ContentFlow — Consultoría-Ti

Compartir
Etiquetas
Gemini Flash 3.7: IA eficiente para empresas