VOZ

Infraestructura de voz en tiempo real para tus aplicaciones.

STT, TTS, gestión de turnos y trazado como un único runtime. Tu agente sigue siendo tuyo.

CADA TRAMO MEDIDO — LATENCIAS POR SALTO
audio inVADframes de 20msSTTparcial <300mstu agenteHTTP + SSETTSprimer audio en 96msaudio out

Cifras objetivo — aún sin medir.

stt.partial · stt.final
STT en tiempo real

Transcripciones parciales y finales mientras la persona habla. Español primero, multilingüe por diseño. Modelos de pesos abiertos disponibles para autoalojamiento.

tts.first_audio
TTS en streaming

La voz se emite por frase, no por respuesta. Las voces son recursos de la plataforma — cambia de proveedor o trae voces clonadas sin tocar código.

CLONACIÓN DE VOZ: PRÓXIMAMENTE
turn.barge_in
Turnos y barge-in

La persona interrumpe, el agente se detiene. El runtime detecta el turno y cancela el TTS a mitad de frase — tu código nunca gestiona temporizadores.

agente hablandola persona interrumpe→ tts.cancel · 61ms
latency.turn
Trazado de latencia

Cada conversación deja una línea de tiempo que puedes consultar. Latencias por salto, totales por turno, exportables.

● 00:03.1 · stt.final142ms
● 00:03.3 · agent.first_token210ms
● 00:03.4 · tts.first_audio96ms
● 00:03.4 · latency.turn448ms

Cifras objetivo — aún sin medir.

Para qué sirve.

CASO DE USO
QUÉ HACE LETSYLABS
Agentes de IA
Bucle de voz completo — tu agente piensa, el runtime escucha y habla.
Automatización de llamadas
Llamadas entrantes y salientes como sesiones programables con DTMF y transferencias.
Transcripción en vivo
Parciales en menos de 300 ms, finales con puntuación, por interlocutor.
Asistentes
Voz web y en app con un barge-in que se siente humano.
Accesibilidad
Voz de baja latencia de entrada y salida para interfaces que hablan.
POST /v1/sessions crea una sesión
WS   wss://…/audio transmite audio + eventos
GET  /v1/sessions/:id/traceconsulta la línea de tiempo