Google impulsa traducción con IA local y sin internet

Google presenta Gemma Translator, un prototipo que escucha, traduce y reproduce conversaciones sin internet con IA local y propia.

Google presentó Gemma Translator, un prototipo de inteligencia artificial capaz de escuchar una conversación, traducirla y reproducirla en otro idioma sin depender de una conexión a internet. La propuesta resulta relevante porque permite resolver una barrera frecuente durante viajes o en zonas con poca cobertura, mientras además plantea una alternativa con mayor control sobre el procesamiento del audio al realizar las tareas directamente en el dispositivo de Google.

El proyecto fue desarrollado por los equipos de Creative Lab y Antigravity como una demostración de las posibilidades de la inteligencia artificial ejecutada localmente. A diferencia de los traductores que necesitan enviar la voz a servidores para analizarla, este sistema procesa cada etapa en el propio equipo, por lo que puede continuar funcionando incluso cuando no existe acceso a una red móvil o Wi-Fi, algo especialmente útil para viajeros que atraviesan zonas con cobertura irregular o limitada.

¿Qué tecnología utiliza el prototipo?

La tecnología utiliza modelos de la familia Gemma, una línea de inteligencia artificial abierta creada por Google para distintos dispositivos. Para las tareas de traducción se apoya en TranslateGemma de Google, un modelo diseñado específicamente para este propósito y que actualmente permite trabajar con 55 idiomas, ampliando las posibilidades de comunicación para personas que necesitan una solución portátil y que no siempre pueden conectarse a internet.

¿Cómo consigue traducir una conversación sin conexión? La respuesta está en que los modelos necesarios están instalados localmente, por lo que el equipo no necesita consultar una plataforma externa para interpretar cada frase. El sistema recibe la voz mediante un micrófono, convierte el audio en texto, procesa el significado en otro idioma y finalmente genera una respuesta que puede aparecer en pantalla y escucharse mediante un altavoz.

¿Cómo funciona la traducción de voz?

El prototipo funciona sobre una Raspberry Pi 5 con 8 GB de RAM y combina varios componentes para completar el proceso de traducción. Incorpora una pantalla táctil, micrófono, altavoz y selector de idiomas, mientras que los modelos Gemma 4 E2B, Moonshine y Kokoro utilizados por Google se encargan de distintas etapas relacionadas con la comprensión, traducción y reproducción de la conversación desarrollada por Google.

En la práctica, el funcionamiento busca ser sencillo para quien lo utiliza: una persona habla frente al dispositivo y el sistema identifica sus palabras antes de generar la traducción correspondiente. Después, el resultado se muestra en la pantalla y también puede reproducirse mediante el altavoz, por lo que la comunicación puede mantenerse de manera bidireccional sin que la voz salga del aparato.

¿Qué ventajas tiene utilizarlo sin internet?

Una ventaja de este enfoque aparece cuando la conectividad deja de ser una opción. Durante un vuelo, una excursión o una visita a una comunidad con cobertura limitada, disponer de traducción local puede evitar que una persona dependa de una señal estable para comunicarse, mientras que mantener el procesamiento en el equipo también refleja la apuesta de Google por herramientas de Google que funcionen sin conexión y reduzcan la dependencia de servidores externos.

La privacidad representa otro punto de interés, aunque el procesamiento local no significa que cualquier uso de inteligencia artificial sea automáticamente privado o libre de riesgos. En este caso, la arquitectura permite que el audio se analice en el propio dispositivo en lugar de enviarlo a servidores remotos, una característica que puede resultar especialmente atractiva para conversaciones en las que los usuarios prefieren mantener sus datos bajo un mayor control y desean reducir la exposición de conversaciones personales a servicios externos de procesamiento.

¿Qué modelos de inteligencia artificial utiliza?

Este proyecto también sirve para mostrar una tendencia más amplia dentro de la inteligencia artificial: llevar modelos capaces de realizar tareas complejas a equipos pequeños y con recursos limitados. Google ha utilizado Gemma de Google como una vía para explorar precisamente ese escenario, donde la capacidad de procesamiento deja de depender exclusivamente de grandes centros de datos y ejecutar funciones cerca del usuario sin conexión.

Es importante aclarar que Gemma Translator no es un nuevo producto comercial disponible para comprar ni sustituir al traductor de la compañía. Se trata de un proyecto experimental construido con componentes que pueden conseguirse comercialmente, cuyo objetivo principal es demostrar lo que puede hacerse al combinar modelos de inteligencia artificial local con hardware compacto y herramientas de código abierto.

¿Cuánto cuesta construir Gemma Translator?

La construcción del prototipo puede costar aproximadamente entre 80 y 100 euros, aunque el precio final depende de los componentes. Además, el trabajo de Google también está disponible bajo una licencia Apache 2.0, por lo que desarrolladores de Google y entusiastas pueden estudiar la propuesta, adaptar el concepto y experimentar con aplicaciones similares para otros escenarios de traducción de Google con recursos limitados, según necesidades.

En ese escenario, Google apuesta por modelos que puedan salir de la nube y acercarse al usuario final sin perder capacidad para resolver tareas complejas. La propuesta de Gemma Translator muestra que Google puede explorar aplicaciones donde la traducción ocurra de manera local, y también que la compañía busca convertir sus modelos abiertos en herramientas prácticas para situaciones cotidianas, incluso cuando no hay conexión disponible.

VER MÁS
- Advertisment -

RELACIONADOS

TE PODRÍA INTERESAR