← Volver a IA
AplicaciónPythonDe pago

AI Voice Assistant — respuestas inteligentes con entrada y salida de voz

Antes: los usuarios tenían que escribir consultas y leer respuestas en texto — lento, poco accesible y poco natural en móvil. Después: hablar una pregunta y obtener una respuesta hablada al instante. Ciclo de voz completo: reconocimiento de voz → razonamiento del LLM → síntesis de voz, todo en menos de dos segundos.

AI Voice Assistant — respuestas inteligentes con entrada y salida de voz

Stack

PythonFastAPIOpenAIWhisperGPT-4ElevenLabsPineconeReactAI

El problema

El cliente necesitaba un asistente conversacional integrado en su producto — uno capaz de responder preguntas sobre su ámbito, entender la entrada hablada y responder con voz natural. Los widgets de chatbot listos para usar solo cubrían texto. La voz requería combinar tres servicios de IA independientes: conversión de voz a texto, un modelo de lenguaje y conversión de texto a voz — con una latencia lo bastante baja como para sentirse como una conversación real.

Opciones consideradas

  1. Solo la Web Speech API del navegador — gratis, latencia cero para el reconocimiento de voz, pero la calidad de reconocimiento no era fiable con acentos no ingleses ni en navegadores móviles. La síntesis de voz sonaba robótica. Rechazado por motivos de calidad.
  2. Plataforma de asistente de voz totalmente gestionada (Voiceflow, VAPI) — rápida para prototipar, pero encerraba al cliente en un proveedor con personalización limitada de la capa de razonamiento. Rechazado para conservar el control sobre el prompt y el contexto del LLM.
  3. OpenAI Whisper + GPT-4 + ElevenLabs, con orquestación a medida — elegido. Precisión de primer nivel en cada etapa; el streaming reduce la latencia percibida; la capa de razonamiento es totalmente personalizable.

Decisión

El audio capturado en el navegador se transmite en streaming a un backend en Python. Whisper transcribe el audio en tiempo real. La transcripción se envía a GPT-4 con un prompt de sistema acotado a la base de conocimiento del ámbito del cliente. La respuesta llega en streaming, token a token; a medida que se completan las frases, se envían a ElevenLabs para su síntesis. Los fragmentos de audio resultantes se reproducen secuencialmente en el navegador — el usuario escucha la primera frase antes de que el modelo haya terminado de generar la respuesta completa.

Implementación

El backend en FastAPI expone un endpoint WebSocket para la transmisión de audio. Una capa de VAD (detección de actividad de voz) en el frontend decide cuándo el usuario ha terminado de hablar antes de volcar el búfer a Whisper. La base de conocimiento se almacena como embeddings vectoriales (OpenAI Embeddings + Pinecone); los fragmentos relevantes se recuperan y se inyectan en la ventana de contexto de GPT-4 en cada turno. El historial de la conversación se mantiene por sesión para dar soporte a preguntas de seguimiento. El widget del frontend es un componente de React autocontenido, integrable mediante una sola etiqueta script.

Resultado

Latencia de extremo a extremo desde el final del habla hasta la primera sílaba de audio: menos de 1,8 segundos de media. La precisión de reconocimiento en terminología específica del ámbito superó el 95%. El widget se desplegó sin cambios en la aplicación anfitriona — una etiqueta script, ningún acoplamiento con el backend.

Disponible para colaboración por contrato

Estoy disponible para colaborar por contrato. Si tiene una idea de proyecto interesante, reserve una llamada por Calendly.

Agenda una llamada de 30 min