Telefonía en tiempo real
El canal de telefonía permite que un pipeline de betool responda o realice llamadas. Se admiten audio en tiempo real, transcripción en streaming, síntesis de voz de baja latencia e interrupción por barge-in.
Arquitectura
Internamente:
- LiveKit gestiona el transporte de audio en tiempo real.
- LiveKit-SIP conecta LiveKit con el trunk SIP de tu operador.
- Un worker dedicado orquesta la llamada: ASR (Deepgram, OpenAI Whisper), LLM (Claude, GPT-4o, modelo privado), TTS (ElevenLabs, OpenAI TTS, Azure).
Este stack se ejecuta como un proceso separado del backend principal. No lo configuras directamente — el operador de tu instancia configura el puente SIP.
Requisitos previos
- Un trunk SIP de un operador (Twilio, Voxbone, OVH, Sewan o un operador nacional).
- Un número entrante y / o la capacidad de realizar llamadas salientes.
- Una clave de un proveedor de ASR y TTS — o un modelo privado en Enterprise.
En el plan Enterprise, betool puede aprovisionar el trunk SIP y los proveedores de voz por ti. De lo contrario, introduce las credenciales en el panel de administración.
Configuración de administración
- Administración → Telefonía → Trunks — introduce las credenciales SIP de tu operador.
- Administración → Telefonía → Números — asocia un número a un trunk y luego a un pipeline de destino.
- Administración → Modelos de voz — elige el ASR (entrada) y el TTS (salida). Se muestran los contadores de uso unitario.
Diseñar un pipeline de voz
Un pipeline de voz siempre empieza con un nodo Start con receiver phone_gateway. A partir de ahí, el pipeline recibe:
exchange.user_message— cada turno de habla transcritoexchange.intent— intención detectada (si activas un agente clasificador)exchange.channel.source_type— fijado aphone_gateway
Los nodos aguas abajo pueden devolver texto que el TTS leerá en voz alta. Las herramientas de voz especializadas (barge-in, colgar, transferir, música de espera) están disponibles automáticamente para los agentes cuando el pipeline tiene phone_gateway aguas arriba.
Buenas prácticas
- Mantén las misiones concisas. La latencia de respuesta importa: un agente que duda durante 4 segundos suena congelado en una llamada. Prefiere modelos rápidos (Haiku, GPT-4o-mini) salvo para los turnos críticos de decisión.
- Activa el barge-in. Quienes llaman deben poder interrumpir al agente. Está activado por defecto.
- Limita los bucles. Un pipeline que itera más de 3 veces en el mismo turno crea un silencio inquietante para quien llama. Supervisa el contador de iteraciones.
Costes
Consulta Precios. Indicativo: 200 créditos por minuto de llamada + ASR / TTS / LLM. Una llamada de 5 minutos suele costar de 0,20 $ a 0,80 $ según el modelo LLM elegido.
Limitaciones conocidas
- Sin soporte de vídeo (todavía).
- La transferencia a un humano requiere un trunk SIP que admita REFER (Twilio es compatible).
- El agente aún no puede identificar a quien llama sin una integración con un CRM.