Agentes de voz en tiempo real
Agentes de voz conversacional construidos sobre tu propio backend: verifican quién habla, leen datos reales de tu base de datos y escriben en los mismos sistemas que usa tu equipo. Nuestro agente hotelero maneja entre 11 y 12 herramientas de servidor contra las mismas funciones de base de datos que la app. Se publica como piloto: todavía sin línea telefónica viva, y por turnos, no full duplex.

Qué es
Un agente que atiende a tu cliente por voz y además ejecuta. Verifica quién habla, lee datos reales de tu base de datos y escribe en los mismos sistemas que ya usa tu equipo. Lo construimos, lo endurecemos y lo seguimos atendiendo después nosotros.
Esta página está escrita como piloto, porque es lo que es. Lo que viene separa lo que ya funciona de lo que todavía no.
Lo que ya hace nuestro agente
El agente hotelero de nuestro propio producto hace login del huésped por voz, informa del hotel, lee la carta real de cada restaurante desde la base de datos, gestiona room service, crea, modifica y cancela reservas de restaurante y de spa, hace triaje de incidencias abriendo un ticket clasificado en el mismo sistema que usa la app, deja recados a recepción y transfiere a recepción cuando la propiedad lo activa.
Son entre 11 y 12 herramientas de servidor cableadas contra las mismas funciones de base de datos que llama la app. No es una integración paralela, es la misma fuente de verdad.
No se inventa nada
La carta se lee de la base de datos. Si un restaurante no tiene carta cargada, el agente lo dice en vez de inventarla, y rechaza platos que no existen. Respeta los días de apertura y las ventanas de reserva reales, y cuando no puede reservar da el horario de verdad en lugar de un error genérico.
Verificado en 18 de 18 escenarios hablados en una ronda de QA de julio de 2026 contra el agente en marcha de una propiedad de demostración, con evidencia de audio, transcripción, interfaz y base de datos. Una QA anterior del preview, en junio de 2026, salió con 21 de 24 pruebas perfectas y ningún fallo crítico.
La identidad se verifica dentro de la llamada
Habitación o nombre más un PIN, con hash y bloqueo por intentos, una sola vez por conversación. El PIN nunca llega al proveedor de voz ni a los registros. El identificador del tenant se resuelve siempre en servidor, nunca desde el modelo ni desde el payload.
El mismo agente soporta dos modos de sesión: dentro de la app, ya autenticado por un vínculo de servidor, sin pedirle nada al huésped; y un modo de llamada con el flujo de verificación hablado completo.
El prompt es ingeniería, no una caja de texto
El prompt de sistema del agente piloto ronda los 31.000 caracteres y se compila desde la configuración de la propiedad con un compilador determinista, sin ningún modelo de lenguaje dentro. Antes de salir pasó por un red team adversarial de doce agentes: 4 de 6 vectores rompían el borrador y 0 de 6 pasaron tras endurecerlo. Una auditoría aparte repasó los esquemas de las herramientas y las dejó sanas, 12 de 12.
Un agente por tenant, dado de alta solo
Dado un hotel con voz activa, una función de borde crea su agente, compila su prompt desde la configuración de esa propiedad y le asigna las herramientas que permiten sus capacidades. Ese camino se probó de punta a punta en producción, con limpieza total después. El equipo del cliente edita nivel y capacidades desde la propia plataforma, y el backend de voz solo lee esa configuración por una función que falla cerrada y que no devuelve datos de huésped ni PIN.
El aislamiento lo comprueba una máquina, no una persona: RLS en las tablas que llevan identificador de tenant y un guardián que descubre tenants y tablas en vez de enumerarlas, ejecutándose en integración continua. A agosto de 2026 vigila 81 tablas con identificador de hotel, y esa ejecución, entre dos hoteles reales, no encontró ninguna fuga cruzada.
Lo que todavía no hace
- No hay número de teléfono vivo atendiendo llamadas de clientes reales. La pata telefónica está diseñada, el número está pendiente de trámite regulatorio y no se ha validado ninguna llamada entrante real de un huésped.
- No consulta disponibilidad ni precios de habitación contra el PMS. Esa capa no está abierta, y la herramienta de disponibilidad cubre solo restaurantes.
- No hay full duplex. Las APIs disponibles hoy funcionan por turnos y ningún proveedor publica cifras oficiales de latencia extremo a extremo, así que no damos ninguna. Sí tenemos medida la latencia de síntesis al leer en alto una respuesta escrita, pero eso es texto a voz, no conversación, y mezclar las dos cifras sería deshonesto.
- Todos los agentes que hemos construido hasta hoy son hoteleros. El mecanismo no es específico de hotel. La prueba en producción sí.
Leer en alto una respuesta no es una conversación
El texto a voz lee algo ya escrito. Un agente de voz escucha, decide y llama a herramientas contra tus datos. Son productos distintos, cuestan dinero distinto y no mezclamos sus cifras.
El stack
Motor conversacional de ElevenLabs para el agente, la voz y la transcripción, con el modelo de lenguaje dentro. Backend propio en Supabase, con funciones de borde y funciones de base de datos con privilegio controlado. Los secretos en un vault, nunca en el repositorio.
La plataforma sobre la que corre este agente está en producción con huéspedes reales en dos hoteles, uno de ellos desde agosto de 2026. Esas cifras son de la plataforma, no del canal de voz, y no las presentamos como resultados de voz.
Pruebas
Preguntas, respondidas
¿Un agente de voz puede atender nuestro teléfono?
¿Cómo evitáis que se invente cosas?
¿Esto solo sirve para hoteles?
¿En qué se diferencia de un chatbot que habla?
¿Están seguros nuestros datos si el proveedor de voz está en medio?
Arranca el motor
Cuéntanos qué estás construyendo en unas pocas preguntas cortas. Un ingeniero senior responde por escrito en 48 horas laborables con una primera lectura de alcance, plazos y precio.
