ChatGPT continúa evolucionando y ahora busca ofrecer una experiencia mucho más cercana a una conversación entre personas. OpenAI presentó GPT-Live-1 y GPT-Live-1 mini, una nueva generación de modelos de voz capaces de escuchar y responder de forma simultánea, además de integrar traducción en tiempo real y un razonamiento más avanzado cuando la consulta lo requiere.
¿Qué novedades incorpora el nuevo modelo de voz?
Durante la presentación oficial, OpenAI mostró cómo el asistente mantiene conversaciones mucho más fluidas gracias a una arquitectura que elimina muchas de las pausas e interrupciones presentes en versiones anteriores. El sistema responde con rapidez, interpreta mejor el contexto y adapta el ritmo del diálogo según la forma en que habla cada usuario.
La compañía explicó que el modelo puede detectar cuándo una persona aún está pensando antes de contestar. Esto permite que ChatGPT espere el momento adecuado para intervenir, haciendo que la interacción resulte más natural y reduciendo la sensación de estar conversando con un sistema automatizado.
¿Cómo logra conversaciones más parecidas a las humanas?
La principal innovación es la arquitectura denominada full-duplex, diseñada para escuchar y hablar al mismo tiempo. Gracias a este avance tecnológico, el asistente puede responder sin necesidad de esperar a que el usuario termine completamente una frase, aunque también es capaz de guardar silencio cuando identifica que la conversación continúa.
Además, ChatGPT puede emitir respuestas breves como «ajá» o «de acuerdo» para demostrar que sigue atento mientras escucha. Esta capacidad hace que la experiencia sea más dinámica y permite interrumpir al asistente con nuevas preguntas sin romper el flujo del diálogo.
¿Qué ocurre cuando una consulta requiere mayor análisis?
OpenAI explicó que, cuando una petición necesita información más compleja o un razonamiento profundo, el nuevo sistema delega esa tarea a GPT-5.5, el modelo más avanzado de la empresa. Mientras tanto, la conversación continúa con normalidad hasta integrar la respuesta completa en el momento oportuno.
Gracias a esta combinación, ChatGPT puede mantener el intercambio de voz mientras procesa solicitudes relacionadas con investigaciones, cálculos o búsquedas de información reciente. Los usuarios también podrán elegir distintos niveles de razonamiento según la dificultad de cada consulta.
La traducción simultánea fue una de las funciones más llamativas
Otra de las demostraciones que más llamó la atención fue la traducción de conversaciones en tiempo real. El nuevo modelo escucha un idioma mientras genera la respuesta en otro prácticamente de forma instantánea, ofreciendo una experiencia similar a la de un intérprete profesional durante una conversación continua.
Con esta función, ChatGPT busca facilitar la comunicación entre personas que hablan idiomas diferentes. La herramienta puede ser útil durante viajes, reuniones de trabajo, clases de idiomas o cualquier situación donde sea necesario traducir una conversación sin pausas prolongadas.
¿Qué medidas de seguridad incorpora?
La empresa también informó que el nuevo sistema recibió entrenamiento específico para conversaciones por voz. El objetivo es identificar situaciones potencialmente delicadas y responder de manera responsable mientras mantiene la interacción con el usuario.
Si detecta contenido riesgoso, ChatGPT puede redirigir la conversación, ofrecer recursos de apoyo o finalizar la interacción cuando sea necesario. OpenAI también reiteró que únicamente utiliza voces autorizadas y que la plataforma no fue diseñada para imitar la voz de personas reales.
¿Cuándo estará disponible para los usuarios?
La actualización comenzará a distribuirse gradualmente para dispositivos con iOS, Android y la versión web del servicio. GPT-Live-1 llegará inicialmente a los planes Go, Plus y Pro, mientras que GPT-Live-1 mini también estará disponible para quienes utilizan la modalidad gratuita.
Con este lanzamiento, ChatGPT da un nuevo paso en la evolución de la inteligencia artificial conversacional. La combinación de una voz más natural, traducción simultánea, razonamiento avanzado y mayores medidas de seguridad anticipa una experiencia más cercana a la comunicación humana para millones de usuarios en todo el mundo.


TE PODRÍA INTERESAR