Biblioteca · Cuatro proyectos de principio a fin

Build-Along: un Voice Agent para un negocio en 7 días

Creador30 minActualizado: octubre de 2026
105 de 105 en la biblioteca

Tiempo: ~30 min de teoría + 7 días de práctica


Lo esencial

En cada colonia hay un consultorio dental donde el teléfono suena sin que nadie conteste. Un salón de belleza donde la recepcionista renunció y las citas se pierden. Un estacionamiento donde después de las 18:00 nadie levanta el teléfono. Estos negocios pierden clientes simplemente porque no hay quien conteste.

Un voice agent es una secretaria virtual que nunca se cansa, no se enferma, no se va de vacaciones y trabaja 24/7. Contesta al primer timbre, habla con voz humana, agenda citas, responde preguntas típicas y transfiere los casos complicados a una persona.

No estás construyendo Siri ni ChatGPT. Estás construyendo un trabajador especializado para un negocio concreto: el consultorio dental de tu cuadra o el restaurante de enfrente. Y lo ofreces por una tarifa mensual fija. Los montos de la lección (por ejemplo, $500 al mes) son ejemplos para hacer cuentas, no un pronóstico de ingresos ni una recomendación de precio: calcula tu costo con las tarifas vigentes y guíate por tu mercado.

En 7 días recorreremos el ciclo completo: de buscar al primer cliente a lanzar un agente que funcione y atienda llamadas reales.

🎨 Imagínalo así: no estás abriendo un call center de 50 operadores. Estás contratando a un practicante genial que se clona gratis. Lo entrenas una vez y trabaja para un cliente. Lo copias y trabaja para un segundo. El límite lo pone tu tiempo para dar soporte.


🎯 End state Day 7

En una semana deberías tener:

  • ✅ Una configuración Vapi + Twilio + Claude API que conteste llamadas reales
  • ✅ El primer cliente pequeño (SMB) conectado (piloto o de pago; las condiciones las acuerdan ustedes)
  • ✅ Un dashboard con las transcripciones de todas las llamadas (para el cliente)
  • ✅ Una plantilla reutilizable para los siguientes 5+ clientes
  • ✅ Un playbook de cold outreach: qué escribir, a quién y qué respuesta obtuviste

NO es la meta del Day 7: un agente AGI perfecto, 10 clientes de golpe, un flow totalmente autónomo. La meta es un circuito que funcione, el primer cliente y entender la economía.


Stack y economía

Componentes y precios

Los precios cambian: revisa las condiciones vigentes en los sitios de los servicios; los precios de Claude, en la página Lo vigente.

Componente Precio Qué hace
Vapi platform fee $0.05/min (SOLO la orquestación, a octubre de 2026) Une el pipeline STT + LLM + TTS
STT (por ejemplo, Deepgram o los modelos de reconocimiento de OpenAI) según la tarifa del proveedor Reconocimiento de voz
Claude API Sonnet 5.5: $2 / $10, Haiku 4.5: $1 / $5 por 1 millón de tokens (entrada / salida, a octubre de 2026) El cerebro LLM (Sonnet para agendar, Haiku para preguntas frecuentes)
ElevenLabs TTS suscripción Starter $6/mes o Creator $22/mes (a octubre de 2026); el consumo depende del volumen Voz TTS premium
Twilio cobro por número y por minutos, según tarifa Número telefónico + conexión con el operador
Calendly API revisa las condiciones en su sitio Integración de citas

Costo real por minuto de conversación (stack completo)

Escribe esto en el chat
Vapi platform:  $0.05 (a octubre de 2026, solo la plataforma)
STT:            según la tarifa del proveedor
Claude API:     depende del modelo y de la duración de la conversación
ElevenLabs TTS: según la tarifa
Twilio:         según la tarifa
---
Total:          la suma de las cinco líneas, calcúlala con tus tarifas

⚠️ No lo confundas con el "$0.05/min" del marketing: es SOLO el platform fee de Vapi. El stack completo real es bastante más caro: el reconocimiento, el LLM, la voz y la telefonía se pagan aparte.

Cálculo mensual: (llamadas al mes) × (duración promedio en minutos) × (costo por minuto según tus tarifas). Para el presupuesto, deja un margen: un modelo caro para las llamadas complejas y uno más barato para las preguntas frecuentes.

Precios para el cliente

Tres modelos:

  1. Per-minute: el cliente paga cada minuto de conversación
  2. Flat retainer: una cantidad fija al mes con un límite de minutos y un cargo extra por encima
  3. Hybrid: un cargo de configuración + pago por minutos (para negocios más grandes)

Para un negocio pequeño, el flat retainer suele ser más claro: el cliente sabe cuánto paga y para ti es predecible. La cantidad la defines con tu costo y tu mercado (en los ejemplos de la lección, $500 al mes).

🎨 Imagínalo así: no vendas el medidor de luz. Vende la luz en el cuarto. Al cliente no le interesan los minutos de conversación. Le interesa que "el teléfono se contesta".


Conceptos clave

  • Voice agent: un flow programático: llamada entrante → STT (reconocimiento de voz) → LLM (Claude genera la respuesta) → TTS (síntesis de voz) → respuesta a quien llama. El ciclo se repite en cada intervención
  • Vapi: plataforma administrada que une el pipeline STT/LLM/TTS y maneja interrupciones, latencia y casos límite. Alternativas: Retell AI, Bland AI
  • Twilio Programmable Voice: el operador telefónico que da un número real y la conexión SIP con Vapi
  • System prompt: el artefacto principal del voice agent. Define la personalidad, la marca, lo que sabe del negocio y lo que puede y no puede decir
  • Tool calling: Claude llama funciones durante la conversación (book_appointment, check_hours, transfer_to_human)
  • Conversation flow: la secuencia de intenciones típicas del usuario: saludo → identificar la necesidad → acción → confirmación → cierre
  • Latency budget: el tiempo total desde que el cliente termina de hablar hasta que el agente empieza a responder. Meta: <1 segundo. Si no, la conversación "se rompe"

Teoría

Por qué los voice agents son un nicho prometedor en 2026

Tres tendencias en paralelo:

  1. La calidad de STT/TTS cruzó el umbral. ElevenLabs, OpenAI Realtime y las voces por defecto de Vapi suenan muy parecido a una persona en una línea telefónica típica. Hace un par de años todos oían al "robot"
  2. Los negocios pequeños siguen perdiendo llamadas. Un negocio pequeño muchas veces no alcanza a contestar todas las entrantes, y una llamada perdida es potencialmente un cliente perdido
  3. El precio bajó bastante en los últimos años. El stack completo cuesta lo suficientemente poco como para que un negocio pequeño pueda pagar un agente de voz

Hay una ventana de oportunidad, pero no se sabe cuánto tiempo seguirá abierta: el mercado puede saturarse con jugadores grandes (como pasó con los chatbots en 2017-2019). Un especialista independiente puede ocupar un nicho local, pero no hay garantías.

🎨 Imagínalo así: no eres la primera persona que vende sitios web a negocios en 2002. Eres quien le vende un sitio a un dentista en 2026 que todavía no tiene uno, pero hoy la barrera de entrada es mucho más baja y la calidad, más alta.


Qué negocio es el target correcto

No todos los negocios pequeños son clientes iguales. Un voice agent funciona mejor donde hay:

  • Alto valor por cliente (un LTV mayor que el pago por tu servicio). Un paciente de un dentista deja bastante más que un cliente de una pizzería, así que al dentista le es más fácil recuperar lo que paga por el servicio
  • Comunicación estandarizada. "Agéndame para una extracción" es un flow repetitivo. "Arma un ramo según el humor de mi esposa", no
  • Un porcentaje alto de llamadas perdidas: el cliente mismo es consciente del dolor
  • Una sola sucursal o una red pequeña. No cadenas corporativas: ahí hace falta venta enterprise

Top 5 nichos (por prioridad):

  1. Consultorio dental ⭐: LTV alto, flow estándar (citas + seguros + preguntas básicas)
  2. Clínica veterinaria: clientes emocionales, el teléfono es crítico, estructura clara de citas
  3. Despacho de abogados (derecho familiar, migración): LTV alto, muchas preguntas frecuentes
  4. Salón de belleza local (4+ estilistas): muchas llamadas, servicios sencillos
  5. Agente inmobiliario (agencia boutique): llamadas fuera de horario, LTV alto

Evita: restaurantes (LTV bajo), pizzerías (te ganan las plataformas de pedidos), sitios de taxi (el teléfono ya está automatizado)


Arquitectura de una llamada

Código
┌─────────────┐    ┌─────────────┐    ┌──────────────┐
│  Cliente    │───▶│  Twilio     │───▶│  Vapi        │
│  marca      │    │  (número)   │    │  (pipeline)  │
└─────────────┘    └─────────────┘    └──────┬───────┘
                                              │
                                              ▼
                                       ┌──────────────┐
                                       │  STT         │
                                       │  (Deepgram)  │
                                       └──────┬───────┘
                                              │
                                              ▼
                                       ┌──────────────┐
                                       │  Claude API  │
                                       │  + tools     │
                                       └──────┬───────┘
                                              │
                                              ▼
                                       ┌──────────────┐
                                       │  TTS         │
                                       │  (ElevenLabs)│
                                       └──────┬───────┘
                                              │
                                              ▼
                                       de vuelta al cliente

Vapi oculta toda la complejidad: tú configuras YAML/JSON y Vapi maneja los flujos.


DAY 1: Nicho + primer prospecto

Meta del día: identificar 20 negocios objetivo, contactar a 5 y acordar 2-3 llamadas con prospectos.

Hour 1-2: Lista de objetivos

Abres Google Maps. Buscas en tu ciudad (o en otra si trabajas remoto):

Escribe esto en el chat
"dentista cerca de [ciudad]"
"clínica veterinaria [ciudad]"
"abogado de migración [ciudad]"

En cada negocio revisas:

  • Número de reseñas: >50 = negocio activo
  • Calificación: 4.0-4.6 = hay margen de mejora. 4.9 = demasiado perfecto, probablemente un negocio familiar que no contratará a alguien de fuera
  • Reseñas negativas recientes: oro puro. Sobre todo: "llamé varios días y nadie contestó", "dejé un mensaje y nunca me regresaron la llamada", "siempre está ocupado". Ese es tu argumento de venta

Lo guardas en una tabla:

Business Rating Reviews Pain signal Owner contact
Smile Dental 4.3 127 "llamé 3 veces" recepción
Cuenca Vet 4.5 89 "buzón lleno" dr_garcia@

Meta: 20 filas. Te toma 2 horas.

Hour 3-4: Cold outreach

No llames en frío. Para el primer contacto, correo > llamada (una llamada sin contexto = eres el mismo spammer del que intentas protegerlos).

Plantilla de correo (en español para Latinoamérica, o adáptala):

Escribe esto en el chat
Asunto: Vi reseñas sobre llamadas perdidas — Smile Dental

Hola Dr. Pérez,

Vi en Google que pacientes mencionan llamadas no contestadas
(reseñas de María L. y Carlos R., última semana).

Construyo asistentes de voz con IA para clínicas como la suya.
El asistente contesta 24/7, agenda citas en su calendario,
responde preguntas comunes y transfiere casos complejos a su
recepcionista.

Costo: [precio] al mes, tarifa fija. Sin contratos largos.

¿15 minutos esta semana para mostrarle un demo en vivo
(con su voz, su clínica)?

— [Tu nombre]
[Teléfono]

Elementos clave:

  • ✅ Un dolor concreto (nombres de las reseñas)
  • ✅ Un precio concreto (no "accesible", sino un número)
  • ✅ Un siguiente paso concreto (un demo de 15 minutos)
  • ❌ NADA de "revolución de la IA" ni "transforma tu negocio"

Envías de 5 a 10 correos. Tus tasas de respuesta solo las conocerás en la práctica. Los correos en frío están regulados por ley (por ejemplo, CAN-SPAM en EE. UU., CASL en Canadá, el GDPR en la UE): revisa las reglas de tu país.

Hour 5: Llamadas con prospectos (si alguien respondió)

Si nadie respondió en el Day 1, no entres en pánico. La meta del Day 1 es la lista + el outreach enviado, no "cliente firmado".

Si alguien respondió, agenda el demo para el Day 5-6 (cuando ya tengas un prototipo que funcione).


DAY 2: Cuenta de Vapi + primer prototipo de voz

Meta del día: un voice agent funcionando (en un número de prueba) con un conversation flow básico.

Hour 1: Configurar Vapi

bash
# Registro en vapi.ai
# Al registrarte te dan créditos iniciales para pruebas (a octubre de 2026, $5; condiciones en el sitio de Vapi)

# Obtienes la API key en el dashboard
export VAPI_API_KEY=your_key_here

En el dashboard de Vapi creas tu primer Assistant. Vapi te da un número telefónico temporal para pruebas: llamas desde tu celular personal y pruebas.

Hour 2-3: Diseño del conversation flow

Antes de configurar el prompt, dibuja el flow en papel:

Código
Llamada → "Buenos días, consultorio dental Smile Dental"
   │
   ├── Quiere agendar → check_calendar → propose_slots → confirm
   │
   ├── Pregunta el horario → responder desde el FAQ
   │
   ├── Pregunta por seguros → responder desde el FAQ
   │
   ├── Caso urgente (dolor) → transfer_to_human (si es horario de atención)
   │                        → save_callback (si es fuera de horario)
   │
   └── Otra cosa → "Tomo sus datos para que la recepcionista le devuelva la llamada"

De 5 a 7 intenciones cubren la mayor parte de las llamadas a un consultorio dental.

Hour 4: Armar el agente en Vapi

Los nombres de los modelos y los parámetros de la configuración de Vapi (voz, reconocimiento, LLM) se actualizan: elige los valores vigentes en el dashboard de Vapi; la lista de modelos de Claude compatibles también está ahí.

Configuración básica de un assistant de Vapi (JSON por API o desde el dashboard):

json
{
  "name": "Smile Dental Reception",
  "voice": {
    "provider": "11labs",
    "voiceId": "EXAVITQu4vr4xnSDxMaL",
    "model": "eleven_turbo_v2_5",
    "stability": 0.5,
    "similarityBoost": 0.8
  },
  "model": {
    "provider": "anthropic",
    "model": "claude-sonnet-5-5",
    "temperature": 0.3,
    "systemPrompt": "Eres la asistente del consultorio dental Smile Dental. Saluda brevemente y pregunta en qué puedes ayudar. Horario: lun-vie 9-18, sáb 10-14. Agenda citas con la herramienta book_appointment. Los casos urgentes, transfiérelos a una persona con transfer_call."
  },
  "transcriber": {
    "provider": "deepgram",
    "model": "nova-2",
    "language": "es"
  },
  "firstMessage": "Buenos días, consultorio dental Smile Dental. Le atiende Ana, ¿en qué le puedo ayudar?",
  "endCallPhrases": ["hasta luego", "que tenga buen día"],
  "maxDurationSeconds": 600
}

Hour 5: Prueba con tu propio teléfono

Llamas al número de prueba de Vapi. Pruebas los escenarios:

  1. "Buenos días, quiero agendar una limpieza"
  2. "¿Cuál es su horario?"
  3. "¿Aceptan el seguro X?"
  4. (silencio de 5 segundos): cómo maneja el agente el silencio
  5. (interrumpes al agente a la mitad): manejo de interrupciones

Anota lo que funciona mal: latencia, pausas poco naturales, repeticiones, alucinaciones.


DAY 3: Prompts a la medida + tool calling

Meta del día: un agente con la personalidad correcta + integración de citas.

Hour 1-2: System prompt con persona

Un prompt por defecto genérico = un agente débil. Un prompt a la medida con el ADN de la marca = un trabajador de verdad.

La clínica, la doctora, los precios y los seguros del ejemplo son inventados: en un proyecto real usa solo datos que el cliente haya verificado.

Código
Eres Ana, la recepcionista virtual del consultorio dental "Smile Dental".

PERSONALIDAD:
- Cálida, profesional, pero no empalagosa
- Hablas con frases cortas (15-25 palabras como máximo)
- Nunca usas jerga ni frases de coaching
- Si no sabes algo, lo dices con honestidad: "Lo consulto con la doctora y le devuelvo la llamada"

CLÍNICA:
- Smile Dental, Cuenca, Av. Florencia Astudillo 7-12
- Horario: lun-vie 9:00-18:00, sáb 10:00-14:00, dom cerrado
- Doctora: Dra. María Pérez, 15 años de experiencia
- Servicios: odontología general, limpieza, implantes, blanqueamiento
- NO hacemos: ortodoncia (brackets), cirugía maxilofacial
- Seguros: aceptamos Salud SA, Ecuasanitas
- Primera consulta: $30, limpieza: $80, implante: $1200

HERRAMIENTAS:
- book_appointment(date, time, service, patient_name, phone)
- check_availability(date, service)
- transfer_to_human(reason)
- save_callback(phone, reason, urgency)

REGLAS:
1. Dolor urgente o lesión → SIEMPRE transfer_to_human (si es horario de atención) o save_callback con urgency=high
2. NO des consejos médicos (solo agenda)
3. NO prometas el precio de un implante sin consulta
4. Si el cliente está enojado, con calma: "Le entiendo, se lo paso a la doctora. Le devuelve la llamada en una hora"
5. Si la persona habla despacio o se confunde, usa frases más simples y habla más despacio

Longitud del system prompt: 300-500 palabras es una referencia razonable; cuanto más largo el prompt, más riesgo de confusión.

Hour 3-4: Herramienta de citas: integración con Calendly

En Vapi defines la herramienta:

json
{
  "type": "function",
  "function": {
    "name": "book_appointment",
    "description": "Agendar una cita para el paciente. Usar cuando el cliente acepta claramente un horario concreto.",
    "parameters": {
      "type": "object",
      "properties": {
        "patient_name": {"type": "string"},
        "phone": {"type": "string"},
        "service": {
          "type": "string",
          "enum": ["consultation", "cleaning", "implant", "whitening"]
        },
        "datetime_iso": {"type": "string", "description": "ISO 8601 datetime"}
      },
      "required": ["patient_name", "phone", "service", "datetime_iso"]
    }
  },
  "server": {
    "url": "https://your-backend.com/api/book"
  }
}

En tu backend (puede ser una Vercel Edge Function):

typescript
// api/book.ts
export default async function handler(req: Request) {
  const { patient_name, phone, service, datetime_iso } = await req.json();

  // Llamada a la API de Calendly
  const response = await fetch(
    "https://api.calendly.com/scheduled_events",
    {
      method: "POST",
      headers: {
        Authorization: `Bearer ${process.env.CALENDLY_TOKEN}`,
        "Content-Type": "application/json"
      },
      body: JSON.stringify({
        event_type: `https://api.calendly.com/event_types/${service}`,
        start_time: datetime_iso,
        invitee: { name: patient_name, phone }
      })
    }
  );

  if (!response.ok) {
    return Response.json({
      success: false,
      message: "Ese horario ya está ocupado. Propón otro."
    });
  }

  return Response.json({
    success: true,
    confirmation: `Cita agendada: ${patient_name}, ${datetime_iso}`
  });
}

Hour 5: Conocimiento de preguntas frecuentes

Las preguntas más frecuentes van de antemano en el system prompt (NO esperamos que Claude las adivine):

Código
PREGUNTAS FRECUENTES:
- "¿Cuánto cuesta una limpieza?" → $80, toma 45 minutos
- "¿Aceptan seguro?" → Salud SA y Ecuasanitas; para otros, llame al call center de su aseguradora
- "¿Se puede en sábado?" → Sí, 10:00-14:00, pero solo con cita
- "¿Cuánto se tarda un implante?" → Primero una consulta ($30), luego la doctora le dirá el plan
- "¿Hacen brackets?" → No, lo canalizamos con un ortodoncista aliado

DAY 4: Ajuste de la calidad de voz

Meta del día: que la conversación suene como con una persona real (o casi).

Hour 1: Elegir la voz

Las voces por defecto de Vapi (TTS de Cartesia/Deepgram) son aceptables, pero suenan "robóticas" en conversaciones largas.

Biblioteca de voces de ElevenLabs (https://elevenlabs.io/voice-library):

  • Busca voces con filtros: idioma (es/en), género, edad, acento
  • Escucha cada una y elige 3 candidatas
  • Haz pruebas A/B en llamadas de prueba con amigos

Recomendación para Latinoamérica (español): español latinoamericano, voz femenina, acento neutro (ni marcadamente mexicano ni argentino: neutro). Si el negocio atiende sobre todo a gente de un solo país, prueba también una voz con el acento local y compara.

Hour 2-3: Ajuste de la personalidad

Por iteraciones: llamas, escuchas, corriges el prompt.

Problemas típicos:

Problema Solución en el prompt
Demasiado formal "Tutea al cliente si es joven y él te tutea"
Respuestas demasiado largas "Máximo 25 palabras por intervención"
Repite el nombre del cliente "El nombre, solo al confirmar la cita, no más seguido"
"Disculpe la molestia" "Nunca te disculpes sin motivo"
Titubea / muletillas Baja la temperature a 0.2-0.3

Hour 4: Optimización de la latencia

Meta: < 1 segundo desde que el cliente termina de hablar hasta que el agente empieza a responder.

Qué influye:

  1. Latencia del STT: depende del proveedor y del modelo de reconocimiento
  2. Latencia del LLM: Haiku es más rápido que Sonnet, y los modelos mayores son aún más lentos
  3. Latencia del TTS: depende del modelo de voz (las variantes turbo y flash son más rápidas)

Mide la demora en tus llamadas de prueba.

Truco para la velocidad: para respuestas cortas (preguntas frecuentes, confirmaciones), cambia a Haiku. Para agendar y para intenciones complejas, Sonnet.

En Vapi se hace con model.fallbackModels:

json
{
  "model": {
    "provider": "anthropic",
    "model": "claude-sonnet-5-5",
    "fallbackModels": ["claude-haiku-4-5"]
  }
}

Hour 5: Casos límite: interrupciones, silencio, acentos

Interrupciones (el cliente interrumpe al agente):

json
{
  "responseDelaySeconds": 0.4,
  "llmRequestDelaySeconds": 0.1,
  "numWordsToInterruptAssistant": 2
}

Silencio (el cliente no habla):

json
{
  "silenceTimeoutSeconds": 7,
  "voicemailDetectionEnabled": true
}

Acentos: si el negocio está en Latinoamérica con clientes de Venezuela / Argentina / Colombia, prueba el código de idioma de Deepgram es (neutro) contra es-419 (Latam).


DAY 5: Integración + casos límite

Meta del día: un número telefónico real + integraciones + el checklist completo de producción.

Hour 1: Configurar el número telefónico

bash
# Te registras en twilio.com
# Compras un número en EE. UU./Ecuador/donde lo necesites
# Precio: cargo mensual por el número + cargo por minutos (revisa las tarifas de Twilio)

# En el dashboard de Vapi → Phone Numbers → Add Twilio Number
# Ingresas:
#   - Twilio Account SID
#   - Twilio Auth Token
#   - Phone Number (formato E.164: +593...)

# Vinculas el número con el Assistant

Llamas desde tu teléfono al número que compraste: debe contestar tu agente.

Hour 2-3: Integración con los sistemas reales

El cliente usa su Google Calendar / Google Sheets / CRM. Te conectas con un webhook en el backend:

typescript
// Webhook en cada llamada terminada
app.post('/vapi-webhook', async (req, res) => {
  const { type, call, transcript, summary } = req.body;

  if (type === 'end-of-call-report') {
    // Lo registramos en Google Sheets (el cliente ve el log)
    await sheets.append({
      spreadsheetId: CLIENT_SHEET_ID,
      range: 'Calls!A:F',
      values: [[
        call.startedAt,
        call.endedAt,
        call.customer?.number,
        summary,
        call.cost,
        transcript.length
      ]]
    });

    // Si hubo cita, enviamos una confirmación por correo al dueño del negocio
    if (call.toolCalls?.some(t => t.name === 'book_appointment')) {
      await sendNotification(`Nueva cita: ${summary}`);
    }
  }

  res.json({ ok: true });
});

Hour 4: Playbook de casos límite

Prepara reacciones para 5 escenarios incómodos:

  1. Cliente enojado: "¿¡Dónde está mi pedido?! ¡Llevo tres días llamando!" → Agente: "Le entiendo, se lo paso al encargado ahora mismo. Anoto su número para que le llamen de urgencia"

  2. Cambio de idioma: el cliente empieza en español y pasa al inglés → System prompt: "Si el cliente cambia de idioma, síguelo"

  3. No entiende al agente (mala señal): dice "¿qué? repita" → Agente: "Disculpe, le escucho mal. Si quiere, le puedo llamar más tarde"

  4. Spam / robot en la línea: → Detección: si hay 3 silencios seguidos de más de 5 seg → terminar la llamada

  5. El cliente pide una persona: "comuníqueme con alguien de verdad" → Tool call: transfer_to_human(reason="customer_requested")

Hour 5: Checklist de despliegue a producción


DAY 6: Onboarding del cliente

Meta del día: cliente firmado, el agente en vivo en su número, las primeras llamadas reales.

Hour 1-2: Llamada de onboarding

1 hora de videollamada con el cliente. Muéstrale:

  1. Demo en vivo: llamas frente a él y le muestras cómo funciona
  2. Dashboard: un Google Sheet con el historial de todas las llamadas (él lo ve)
  3. Opciones de personalización: qué se puede y qué no se puede cambiar
  4. Precio: la cantidad mensual acordada (en el ejemplo, $500), la primera semana gratis (prueba)
  5. Contrato: un documento sencillo de 1 página (correo + respuesta "de acuerdo")

🎨 Imagínalo así: no vendas IA. Vende "ya no pierde llamadas". El cliente compra el resultado, no la tecnología.

Hour 3: Recolección de conocimiento

Le pides al cliente:

  • El horario (exacto, incluidos los días festivos)
  • Servicios + precios (si se pueden decir, o "se confirma en la visita")
  • Preguntas frecuentes: lo que de verdad oyen todos los días
  • La lista de servicios que NO hacen (evita expectativas equivocadas)
  • Nombre y contacto de la persona a quien transferir
  • Preferencias de voz de marca: formal / informal

Escribes todo esto en el system prompt (formato del Day 3). 30-45 minutos de trabajo.

Hour 4: Dashboard de seguimiento

El cliente necesita ver que el agente trabaja. La opción más simple es un Google Sheet compartido:

Hora Duración Teléfono Resultado Transcripción
14:23 2:14 +593... booking_confirmed [link]
15:47 0:45 +593... hours_question [link]
16:12 4:33 +593... transferred_to_human [link]

Opción avanzada (semana 2+): un dashboard sencillo en Next.js sobre Vercel. Pero para el Day 6, un Google Sheet alcanza.

Hour 5: Go live

  • Cambias el enrutamiento de Twilio de la configuración actual a tu agente (o el cliente desvía sus llamadas)
  • Las primeras 24 horas te quedas pegado a tu teléfono
  • Si algo se rompe, regresas al número anterior del cliente (ten listo el rollback)

Acuerdas un check-in a las 6 horas: hablas con el cliente para saber cómo fueron las primeras llamadas.


DAY 7: Refinamiento + escala

Meta del día: el agente estabilizado, la primera factura emitida, el plan de la semana 2 listo.

Hour 1-2: Revisión de las primeras 20 llamadas

Abres todas las transcripciones. Buscas patrones:

  • ¿Dónde alucinó Claude? ("Dijo que hacemos brackets y no hacemos")
  • ¿Dónde no se cerró la llamada? (el cliente colgó a la mitad)
  • ¿Dónde falló la transferencia a una persona? (la pasó a quien no era / no avisó)
  • ¿Dónde no se logró la cita? (Calendly devolvió un error y el agente no lo manejó bien)

Cada problema = un parche al system prompt o a una herramienta.

Hour 3: Ajustar los prompts con conversaciones reales

Los datos más valiosos son las transcripciones reales. Las usas para:

  1. Agregar al FAQ lo que los clientes de verdad preguntan
  2. Quitar del prompt lo que nadie pregunta (ahorras tokens)
  3. Afinar la personalidad con base en las reacciones en vivo

Hour 4: Factura + retainer

Emites la primera factura por la cantidad acordada. Método de pago:

  • EE. UU. / Canadá: Stripe (fácil) o Wise
  • Latinoamérica: PayPal, transferencia bancaria local o la pasarela de pagos que se use en tu país
  • Otros países: elige el método de pago según las leyes y los servicios disponibles en tu país y en el del cliente, considerando las restricciones cambiarias y las sanciones

Acuerdas un cobro mensual recurrente: un cargo automático el día 1 de cada mes. Revisa también cómo debes facturar según el régimen fiscal de tu país.

Hour 5: Plan de la semana 2

Tienes:

  • 1 voice agent funcionando
  • 1 cliente que paga
  • ~20 transcripciones con insights
  • Una plantilla de Vapi reutilizable

Plan de la semana 2:

  1. Lun: outreach a 10 negocios pequeños nuevos (usas la plantilla del Day 1)
  2. Mar: afinar el pitch con lo aprendido (ahora tienes un caso de estudio con cifras)
  3. Mié-Jue: llamadas de demo con prospectos
  4. Vie: cerrar 1-2 clientes nuevos

El ritmo de crecimiento lo definen tus horas de soporte y la demanda del mercado: aquí no hay metas fijas de número de clientes.


Economía real

Costo de configuración (una vez por cliente, estimación de tiempo del autor)

Concepto Tiempo Costo
Outreach + ventas 5h $0
Configuración de Vapi 8h $0
Prompt a la medida + herramientas 6h $0
Integración (Calendly, Sheets) 5h $0
Ajuste de voz 3h $0
Onboarding 3h $0
Total por cliente 30h $0 en efectivo

Costo variable por cliente al mes

Escribe esto en el chat
Llamadas/mes promedio:  N (estímalo junto con el cliente)
Duración promedio:      M minutos
Minutos totales:        N × M

Costo por minuto:       según tus tarifas (ver la sección "Stack y economía")
Costo variable:         Minutos totales × Costo por minuto

+ Número de Twilio:     según tarifa
+ Suscripción ElevenLabs: según tarifa (se puede repartir entre clientes)
---
Costo por cliente:      la suma de las líneas

Ingreso por cliente

Margen = el precio acordado con el cliente menos el costo variable y la parte de tus gastos fijos. Calcúlalo con tus tarifas y los datos del cliente: no hay valores universales.

Escala

A medida que crece el número de clientes, crece el tiempo de monitoreo, de ajustes de prompts y de soporte. El límite para una sola persona lo pone ese tiempo. Cuando se acaba, sumas a alguien para el onboarding y el monitoreo, o revisas el precio.


Errores comunes

Día Error Protección
Day 1 Elegir el nicho equivocado (pizzería < dentista) Filtrar por un LTV mayor que el precio del servicio
Day 1 "Revolución de la IA" en el pitch Un dolor concreto + cifras
Day 2 Un primer prototipo demasiado complejo Empieza simple: 1 intención, luego amplía
Day 3 System prompt > 800 palabras → confusión Mantenlo en 300-500 palabras, pasa el FAQ a herramientas
Day 3 Escribir fijos precios que cambian "Se confirma al agendar" para los que cambian
Day 4 Voz por defecto de Vapi = "robot" → el cliente cree que es spam Una voz premium de ElevenLabs es obligatoria
Day 4 Latencia >2 segundos Haiku para el FAQ, Sonnet solo para lo complejo
Day 5 Desplegar sin pruebas de estrés 10 llamadas de prueba con distintos escenarios, obligatorias
Day 6 El cliente no entiende qué compra Demo en vivo > diapositivas
Day 6 Sin plan de rollback Respaldo al número anterior del cliente, listo
Day 7 No revisar transcripciones Revisión semanal = obligatoria; si no, la calidad se degrada
Day 7 Precio demasiado bajo Calcula con tu costo: por debajo de él trabajas con pérdida

Lo que tienes al final del Day 7

✅ Un voice agent en vivo que contesta llamadas reales 24/7 ✅ El primer cliente pequeño conectado (condiciones de pago acordadas) ✅ Un dashboard (Google Sheet) con las transcripciones de todas las llamadas ✅ Una plantilla reutilizable: el siguiente cliente será más rápido ✅ Un playbook de outreach con tus tasas de respuesta reales ✅ Economía real: un cálculo con las cifras reales del primer cliente

Y lo más importante: tienes la plantilla de un caso de estudio con cifras para los siguientes prospectos: "[Clínica]: en el primer mes el agente atendió [N] llamadas que antes se perdían, y [M] de ellas se convirtieron en citas." Usa solo datos reales del cliente y solo con su permiso.


Herramientas y recursos

  • Vapi: plataforma de voice agents (créditos iniciales para pruebas, condiciones en el sitio)
  • Twilio Phone Numbers: compra y configuración de números reales
  • Calendly API: integración de citas
  • ElevenLabs Voice Library: catálogo de voces premium
  • Deepgram: uno de los STT más populares para conversaciones en tiempo real
  • Claude Console: claves de la Claude API y monitoreo
  • Vercel Edge Functions: hosting para los webhooks (un proyecto comercial requiere un plan de pago de Vercel; también puedes usar Cloudflare Workers)
  • Cal.com: alternativa open source a Calendly si el cliente quiere autoalojarla

Ideas clave

No construyas un voice agent universal. Construye un trabajador especializado para un nicho y un negocio. El dentista no compra "IA". Compra "no perdemos llamadas". Vende el resultado, no la tecnología.

La economía funciona solo si un cliente le deja al negocio bastante más de lo que cuesta tu servicio (LTV mayor que el precio del agente). Un consultorio dental suele cumplirlo; una pizzería, normalmente no. Filtra a los prospectos con este criterio desde el Day 1; si no, llegarás al Day 7 con un contrato que no se paga solo.

El tiempo de configuración baja con cada cliente nuevo: la plantilla, los prompts reutilizados y el FAQ acumulado dan un efecto compuesto. Cuánto te tomará cada cliente siguiente lo verás en tus propios proyectos.


Lecciones relacionadas


Siguiente lección

→ Build-Along: AI Consulting Practice

La marca se guarda solo en este navegador y no se envía a ningún sitio. Mi progreso