VOZ
Infraestructura de voz en tiempo real para tus aplicaciones.
STT, TTS, gestión de turnos y trazado como un único runtime. Tu agente sigue siendo tuyo.
CADA TRAMO MEDIDO — LATENCIAS POR SALTO
Cifras objetivo — aún sin medir.
stt.partial · stt.final
STT en tiempo real
Transcripciones parciales y finales mientras la persona habla. Español primero, multilingüe por diseño. Modelos de pesos abiertos disponibles para autoalojamiento.
tts.first_audio
TTS en streaming
La voz se emite por frase, no por respuesta. Las voces son recursos de la plataforma — cambia de proveedor o trae voces clonadas sin tocar código.
CLONACIÓN DE VOZ: PRÓXIMAMENTEturn.barge_in
Turnos y barge-in
La persona interrumpe, el agente se detiene. El runtime detecta el turno y cancela el TTS a mitad de frase — tu código nunca gestiona temporizadores.
latency.turn
Trazado de latencia
Cada conversación deja una línea de tiempo que puedes consultar. Latencias por salto, totales por turno, exportables.
● 00:03.1 · stt.final142ms
● 00:03.3 · agent.first_token210ms
● 00:03.4 · tts.first_audio96ms
● 00:03.4 · latency.turn448ms
Cifras objetivo — aún sin medir.
Para qué sirve.
CASO DE USO
QUÉ HACE LETSYLABS
Agentes de IA
Bucle de voz completo — tu agente piensa, el runtime escucha y habla.
Automatización de llamadas
Llamadas entrantes y salientes como sesiones programables con DTMF y transferencias.
Transcripción en vivo
Parciales en menos de 300 ms, finales con puntuación, por interlocutor.
Asistentes
Voz web y en app con un barge-in que se siente humano.
Accesibilidad
Voz de baja latencia de entrada y salida para interfaces que hablan.
POST /v1/sessions crea una sesión
WS wss://…/audio transmite audio + eventos
GET /v1/sessions/:id/traceconsulta la línea de tiempo