Documentación

Telefonía en tiempo real

Voz entrante / saliente vía LiveKit + SIP, ASR/TTS en streaming, barge-in, multilingüe.

Telefonía en tiempo real

El canal de telefonía permite que un pipeline de betool responda o realice llamadas. Se admiten audio en tiempo real, transcripción en streaming, síntesis de voz de baja latencia e interrupción por barge-in.

Arquitectura

Internamente:

  • LiveKit gestiona el transporte de audio en tiempo real.
  • LiveKit-SIP conecta LiveKit con el trunk SIP de tu operador.
  • Un worker dedicado orquesta la llamada: ASR (Deepgram, OpenAI Whisper), LLM (Claude, GPT-4o, modelo privado), TTS (ElevenLabs, OpenAI TTS, Azure).

Este stack se ejecuta como un proceso separado del backend principal. No lo configuras directamente — el operador de tu instancia configura el puente SIP.

Requisitos previos

  • Un trunk SIP de un operador (Twilio, Voxbone, OVH, Sewan o un operador nacional).
  • Un número entrante y / o la capacidad de realizar llamadas salientes.
  • Una clave de un proveedor de ASR y TTS — o un modelo privado en Enterprise.

En el plan Enterprise, betool puede aprovisionar el trunk SIP y los proveedores de voz por ti. De lo contrario, introduce las credenciales en el panel de administración.

Configuración de administración

  1. Administración → Telefonía → Trunks — introduce las credenciales SIP de tu operador.
  2. Administración → Telefonía → Números — asocia un número a un trunk y luego a un pipeline de destino.
  3. Administración → Modelos de voz — elige el ASR (entrada) y el TTS (salida). Se muestran los contadores de uso unitario.

Diseñar un pipeline de voz

Un pipeline de voz siempre empieza con un nodo Start con receiver phone_gateway. A partir de ahí, el pipeline recibe:

  • exchange.user_message — cada turno de habla transcrito
  • exchange.intent — intención detectada (si activas un agente clasificador)
  • exchange.channel.source_type — fijado a phone_gateway

Los nodos aguas abajo pueden devolver texto que el TTS leerá en voz alta. Las herramientas de voz especializadas (barge-in, colgar, transferir, música de espera) están disponibles automáticamente para los agentes cuando el pipeline tiene phone_gateway aguas arriba.

Buenas prácticas

  • Mantén las misiones concisas. La latencia de respuesta importa: un agente que duda durante 4 segundos suena congelado en una llamada. Prefiere modelos rápidos (Haiku, GPT-4o-mini) salvo para los turnos críticos de decisión.
  • Activa el barge-in. Quienes llaman deben poder interrumpir al agente. Está activado por defecto.
  • Limita los bucles. Un pipeline que itera más de 3 veces en el mismo turno crea un silencio inquietante para quien llama. Supervisa el contador de iteraciones.

Costes

Consulta Precios. Indicativo: 200 créditos por minuto de llamada + ASR / TTS / LLM. Una llamada de 5 minutos suele costar de 0,20 $ a 0,80 $ según el modelo LLM elegido.

Limitaciones conocidas

  • Sin soporte de vídeo (todavía).
  • La transferencia a un humano requiere un trunk SIP que admita REFER (Twilio es compatible).
  • El agente aún no puede identificar a quien llama sin una integración con un CRM.