OpenAI Revoluciona la Inteligencia Vocal: Nuevas Funciones en su API para Hablar, Transcribir y Traducir en Tiempo Real

OpenAI presenta su nueva ola de inteligencia vocal en la API

Este jueves 7 de mayo de 2026, OpenAI anunció la incorporación de varias funciones de inteligencia vocal en su API, diseñadas para que los desarrolladores puedan crear aplicaciones capaces de conversar, transcribir y traducir interacciones con los usuarios de forma natural y fluida.

Nuevos modelos de voz: GPT-Realtime-2, Translate y Whisper

La compañía lanzó GPT‑Realtime‑2, un modelo de voz avanzado que ofrece una simulación vocal realista y está potenciado con la capacidad de razonamiento de la clase GPT‑5. A diferencia de su predecesor (GPT-Realtime-1.5), este nuevo modelo está diseñado para manejar solicitudes más complejas por parte de los usuarios.

Además, OpenAI presentó GPT‑Realtime‑Translate, una herramienta de traducción en tiempo real que «se mantiene al ritmo» del usuario de manera conversacional. Este servicio soporta más de 70 idiomas de entrada (los que puede comprender) y 13 idiomas de salida (los que transmite al hablante).

Por último, GPT-Realtime-Whisper ofrece capacidades de transcripción de voz a texto en vivo, capturando las interacciones tal como ocurren.

Declaraciones de OpenAI

“En conjunto, los modelos que lanzamos transforman el audio en tiempo real, pasando de simples llamadas y respuestas a interfaces de voz que realmente pueden trabajar: escuchar, razonar, traducir, transcribir y actuar mientras se desarrolla una conversación”, afirmó la compañía.

¿A quiénes beneficiarán estas actualizaciones?

Según OpenAI, estas nuevas capacidades tienen un amplio espectro de aplicaciones:

  • Atención al cliente: empresas que deseen expandir sus servicios de soporte.
  • Educación: plataformas de aprendizaje de idiomas y herramientas educativas.
  • Medios y comunicación: traducción y transcripción en vivo para periodistas y creadores.
  • Eventos y plataformas de creadores: interacciones en tiempo real con audiencias globales.

Diseño abstracto de inteligencia vocal con ondas sonoras

Representación visual de la interacción de voz con inteligencia artificial.

Seguridad y prevención de abusos

OpenAI ha implementado barreras de seguridad para evitar el mal uso de estas funciones, como la generación de spam, fraude u otro tipo de abuso online. Se han integrado disparadores en el sistema para que “las conversaciones puedan detenerse si se detecta que violan nuestras pautas de contenido dañino”, explicó la empresa.

Modelos de facturación

Todos los nuevos modelos de voz están incluidos en la API Realtime de OpenAI. Translate y Whisper se facturan por minuto, mientras que GPT-Realtime-2 se factura por consumo de tokens.

Con estas innovaciones, OpenAI da un paso firme hacia interfaces de voz más inteligentes y versátiles, abriendo un abanico de posibilidades para desarrolladores y empresas en todo el mundo.

Comparte este artículo

Otras notas de tu interés:

Economia

River AI recauda $1.1 mil millones liderada por General Catalyst para crear agentes de IA personales y entrenables

Economia

Trump y el impuesto pied-à-terre en Nueva York: EE. UU. sopesa frenar la medida

Espectáculos y Entretenimiento

TikTok permitido de nuevo en EE. UU.: la administración Trump impulsa la restauración del servicio

Economia

Brad Lightcap deja OpenAI: el ejecutivo clave anuncia su salida para “empezar algo nuevo”

Espectáculos y Entretenimiento

Spotify lanza los perfiles ‘AI Persona’ y excluirá su música de las recomendaciones

Politica Internacional

Anthropic añade marcas de agua invisibles a Claude para cumplir con el EU AI Act

Economia

El boom del home staging en Miami: cómo el lujo transforma el mercado inmobiliario

Economia

Demócratas, Congreso y criptomonedas: el plan que mira a Wall Street y a los reguladores en EE.UU.

Economia

Laboratorios de IA en EE. UU. desaceleran las pruebas de modelos de alto riesgo

Negocios

Miami Slice llega a Coconut Grove: la pizza más esperada abre sus puertas el 12 de agosto