Biblioteca · Trucos de usuario avanzado

Herramientas de voz: Aqua Voice, el modo /voice y Whisper

Usuario con confianza40 minActualizado: octubre de 2026
48 de 105 en la biblioteca

Tiempo: ~20 min de teoría + 20 min de práctica


Lo esencial

Escribir los prompts (las instrucciones para la IA) a mano no es la única opción. Hay tres formas de hablarle a Claude Code con la voz: apps de dictado aparte (por ejemplo, Aqua Voice), el modo /voice integrado y Whisper local para quien no quiere mandar audio a la nube. Cuando tienes las manos ocupadas o las ideas llegan más rápido que los dedos, la voz gana.

🎨 Imagínalo así: dictarle a Claude Code es como dictarle una carta a un asistente. Tú hablas, él escribe. La diferencia: el asistente cobra un sueldo, y la app de dictado cuesta una suscripción o nada. Y no se cansa.


Conceptos clave

  • Aqua Voice: un STT (Speech-to-Text, reconocimiento de voz) especializado, enfocado en términos técnicos
  • Modo nativo /voice: el dictado por voz integrado en Claude Code
  • Whisper API (OpenAI): transcripción en la nube, de uso general
  • Whisper local: transcripción sin enviar nada a la nube
  • VoiceMode MCP: Whisper STT + Kokoro TTS (Text-to-Speech, síntesis de voz a partir de texto) para conversar por voz en ambos sentidos
  • Dictado en cualquier app: Aqua Voice, Wispr Flow, MacWhisper; hablas y el texto aparece donde está el cursor

Teoría

Aqua Voice: por qué está pensado para desarrolladores

Los asistentes de voz comunes (Siri, el dictado de Google) se equivocan con los términos técnicos:

  • claude-sonnet-5-5 → "clo soné cinco cinco"
  • npm install -g → "ene pe eme instal ge"
  • Anthropic API key → "antrópic a pe i qui" (adivina qué sale)

🎨 Imagínalo así: un dictáfono común es como un intérprete que solo sabe palabras del día a día. Sirve para ir al súper, pero en un juicio fracasa. Aqua Voice es como un intérprete que vivió tres años en Silicon Valley y conoce todo el vocabulario técnico.

Aqua Voice está ajustado para términos técnicos, comandos de bash (el lenguaje de comandos de la terminal), nombres de librerías y patrones de código, según sus desarrolladores.

Características (a octubre de 2026, según el sitio del servicio):

Parámetro Valor
Propósito Dictado enfocado en términos técnicos
Precisión El servicio declara 97.3% en su propia prueba AISpeak (dato del fabricante, sin verificación independiente)
Idiomas Declara 49; revisa en el sitio que el español esté soportado antes de pagar
Integración System-wide (funciona en todo el sistema)
Plataformas La plataforma principal es macOS; revisa en el sitio si hay otras versiones
Precio Tiene un nivel gratis con un límite de palabras y planes de pago sin límite de palabras; precios vigentes en el sitio

Alternativas que declaran soporte para español (a octubre de 2026): Wispr Flow (Mac, Windows, iPhone y Android, más de 100 idiomas, nivel gratis con un límite semanal de palabras) y MacWhisper (funciona localmente en Mac, más de 100 idiomas, las funciones básicas son gratis). Catálogo y condiciones vigentes: Herramientas.

Cómo funciona:

  1. Presionas un atajo de teclado (configurable)
  2. Hablas y ves la onda de audio en la barra de estado
  3. Sueltas la tecla → el texto aparece donde está el cursor
  4. Funciona en VS Code, la Terminal, el navegador y cualquier campo de texto

Instalación:

bash
# Desde el sitio
# aquavoice.com → Get Started on Mac → descargar e instalar

Primera configuración:

  1. Abre Aqua Voice
  2. System Settings → Privacy & Security → Microphone → permitir
  3. Configura el atajo (recomiendo Option+Space o Cmd+Shift+V)
  4. Elige el modo de trabajo que te convenga (la lista de modos está en la configuración de la app)

El modo nativo /voice en Claude Code

Claude Code tiene dictado por voz integrado, sin apps externas.

🎨 Imagínalo así: antes tenías que conectar un micrófono externo con un adaptador. Ahora el micrófono viene integrado: abres y hablas.

Activación:

Escribe esto en el chat
# En Claude Code escribe
/voice

# Elige el modo: mantener presionado o presionar dos veces
/voice hold
/voice tap

Qué hace:

  • Modo hold (por defecto): mantienes Space → hablas → sueltas → el texto se inserta en tu solicitud
  • Modo tap: presionas Space → hablas → presionas otra vez → la solicitud se envía
  • La transcripción está ajustada para términos de programación (regex, OAuth, JSON); el nombre del proyecto y la rama de git se sugieren automáticamente
  • Funciona en la CLI de la terminal y en la extensión de VS Code; no funciona en sesiones en la nube ni por SSH
  • Requiere iniciar sesión con una cuenta de claude.ai (no con clave de API); la transcripción no consume tokens ni los límites del plan
  • El idioma del dictado se toma de la opción language (/config); por defecto es inglés y el español está soportado: elígelo, o el texto saldrá distorsionado
  • El audio se envía a los servidores de Anthropic para transcribirlo: para grabaciones confidenciales usa Whisper local

Diferencia con Aqua Voice:

Parámetro Modo /voice Aqua Voice
Disponibilidad Solo en Claude Code (CLI y VS Code) System-wide (en todas partes)
Configuración /voice y elegir el idioma 5 minutos
Precisión técnica Ajustada para términos de programación Declara 97.3% (dato del fabricante)
Precio No consume tokens ni límites del plan Nivel gratis y planes de pago
Personalización Modos hold/tap, tecla configurable Atajos, modos
Sin conexión No (el audio va a los servidores de Anthropic) Revisa en el sitio

Recomendación: /voice para empezar rápido y usarlo de vez en cuando. Aqua Voice, si la voz se vuelve tu forma principal de escribir.


Whisper API: transcripción en la nube

OpenAI Whisper es un modelo de transcripción muy popular. Por la API se cobra por minuto de audio (el modelo whisper-1). OpenAI también tiene modelos de reconocimiento más nuevos (por ejemplo, gpt-4o-transcribe y gpt-4o-mini-transcribe): revisa los precios vigentes en la página de precios de OpenAI.

🎨 Imagínalo así: Whisper es como un intérprete judicial con experiencia. Preciso, multilingüe, trabaja con grabaciones de distinta calidad. Pero cada vez hay que mandarle la grabación a la nube.

Uso con Python (lenguaje de programación):

python
import openai
import sounddevice as sd
import numpy as np
import scipy.io.wavfile as wav
import tempfile

client = openai.OpenAI()  # la clave se toma de la variable de entorno OPENAI_API_KEY

def record_and_transcribe(duration_seconds=10):
    """Graba audio y lo transcribe con Whisper"""
    print(f"Grabando {duration_seconds} segundos... (¡habla!)")
    
    # Grabación
    sample_rate = 16000
    recording = sd.rec(
        int(duration_seconds * sample_rate),
        samplerate=sample_rate,
        channels=1
    )
    sd.wait()
    
    print("Transcribiendo...")
    
    # Guardamos en un archivo temporal
    with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as tmp:
        wav.write(tmp.name, sample_rate, recording)
        
        with open(tmp.name, "rb") as audio_file:
            transcription = client.audio.transcriptions.create(
                model="whisper-1",
                file=audio_file,
                language="es"  # o "en", o quítalo para que detecte el idioma
            )
    
    return transcription.text

# Ejemplo de uso con Claude
import anthropic

claude = anthropic.Anthropic()  # la clave se toma de la variable de entorno ANTHROPIC_API_KEY

while True:
    user_input = record_and_transcribe(duration_seconds=8)
    print(f"Tú: {user_input}")
    
    if "alto" in user_input.lower():
        break
    
    response = claude.messages.create(
        model="claude-sonnet-5-5",
        max_tokens=1000,
        messages=[{"role": "user", "content": user_input}]
    )
    
    print(f"Claude: {''.join(b.text for b in response.content if b.type == 'text')}")

Instalar dependencias:

bash
pip install openai sounddevice scipy numpy anthropic

Whisper local: privacidad total

Para tareas en las que no puedes mandar audio a la nube (negociaciones con clientes, datos confidenciales).

🎨 Imagínalo así: Whisper local es como contratar a un intérprete que va a tu casa y firma un acuerdo de confidencialidad. Más lento que la nube, pero todo se queda contigo.

bash
# Instalación
pip install openai-whisper ffmpeg-python
# En Mac: brew install ffmpeg
python
import whisper

# Cargamos el modelo (una sola vez, queda en caché)
# tiny=39MB, base=74MB, small=244MB, medium=769MB, large=1.5GB
model = whisper.load_model("small")  # equilibrio entre velocidad y calidad

def transcribe_local(audio_path: str, language: str = "es") -> str:
    """Transcribe audio localmente, sin nube"""
    result = model.transcribe(
        audio_path,
        language=language,
        fp16=False  # fp16=True si tienes GPU
    )
    return result["text"]

# Ejemplo
text = transcribe_local("grabacion.wav")
print(text)

Comparación de modelos de Whisper:

Modelo Tamaño Velocidad (CPU, aproximada) Calidad
tiny 39 MB ~10x tiempo real Básica
base 74 MB ~7x tiempo real Normal
small 244 MB ~4x tiempo real Buena
medium 769 MB ~2x tiempo real Muy buena
large 1.5 GB ~1x tiempo real La mejor

En Apple Silicon funcionan más rápido las implementaciones optimizadas (por ejemplo, whisper.cpp o la app MacWhisper); el paquete estándar openai-whisper calcula en CPU o GPU.


VoiceMode MCP: voz en ambos sentidos

VoiceMode MCP permite que Claude Code te conteste hablando, no solo que te escuche.

🎨 Imagínalo así: sin VoiceMode, es una conversación a través de un vidrio. Tú hablas y él responde por escrito. Con VoiceMode es una conversación normal en voz alta, como con un colega.

bash
# Instalación como plugin de Claude Code
claude plugin install voicemode@voicemode
/voicemode:install
/voicemode:converse

# Alternativa: instalador en Python
uvx voice-mode-install

Qué hace:

  • STT: Whisper.cpp (local) o la API de OpenAI como respaldo
  • TTS: Kokoro TTS (abierto, funciona localmente) o la API de OpenAI
  • Integración con Claude Code para conversar por voz

Útil para: programar en pareja con la IA, revisar código en voz alta, dictar documentación.


Escenarios prácticos

Escenario 1: desarrollo por voz

Código
Abres VS Code y activas Aqua Voice
→ Dices: "agrega validación de email a la función de registro"
→ El texto aparece en el chat de Claude Code
→ Claude escribe el código
→ Dices en voz alta la siguiente tarea

Escenario 2: diario de voz del desarrollador

bash
#!/usr/bin/env bash
# voice-standup.sh — standup por voz cada mañana

RECORDING_FILE="/tmp/standup-$(date +%Y%m%d).wav"

# Grabamos la voz (90 segundos)
rec -r 16000 -c 1 "$RECORDING_FILE" trim 0 90

# Transcribimos con la Whisper API
TRANSCRIPT=$(curl -s -X POST "https://api.openai.com/v1/audio/transcriptions" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F file="@$RECORDING_FILE" \
  -F model="whisper-1" \
  -F language="es" | jq -r '.text')

# Lo estructuramos con Claude
STANDUP=$(echo "$TRANSCRIPT" | claude -p "
Convierte este standup por voz en un formato estructurado:
- Qué hice ayer
- Qué planeo hoy
- Bloqueos
")

# Guardamos
echo "$STANDUP" >> ~/standups/$(date +%Y-%m).md
echo "¡Standup guardado!"

Escenario 3: transcribir reuniones con clientes

python
# Whisper local: el audio no sale a la nube (el texto transcrito sí va después a la API de Claude)
# Graba conversaciones solo con el consentimiento de los participantes
import whisper
import anthropic

model = whisper.load_model("medium")
claude = anthropic.Anthropic()

# Transcribimos la grabación de la reunión
transcript = model.transcribe("meeting-2026-05-09.mp3", language="es")

# Extraemos las tareas con Claude
response = claude.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=2000,
    messages=[{
        "role": "user",
        "content": f"De esta transcripción de la reunión extrae: "
                   f"la lista de tareas con responsables, las decisiones clave "
                   f"y las preguntas sin respuesta.\n\nTranscripción:\n{transcript['text']}"
    }]
)

print("".join(b.text for b in response.content if b.type == "text"))

Dictado de macOS: alternativa gratuita

La función de dictado integrada en macOS (en muchos casos funciona sin internet; depende del idioma y de la versión de macOS):

Código
System Settings → Keyboard → Dictation → On
Atajo: presionar Fn dos veces (o configurarlo)
Idioma: Spanish (soportado)

Ventajas: gratis, a menudo sin conexión, funciona en todas partes Desventajas: se equivoca más con términos técnicos, no tiene API


Práctica

  1. Activa el dictado de macOS (System Settings → Keyboard) y prueba a dictar un prompt en Claude Code
  2. Instala y configura Aqua Voice (aquavoice.com) u otra opción de dictado; compara la precisión con términos técnicos
  3. Crea un script voice-note.sh que grabe una nota de voz y la guarde en un archivo Markdown
  4. (opcional) Conecta VoiceMode MCP para conversar por voz en ambos sentidos

Herramientas y recursos


Conclusiones clave

Aqua Voice es una de las opciones de entrada de voz técnica: funciona en todo el sistema y en todas las apps. Revisa en el sitio los precios y el soporte del español.

El modo nativo /voice de Claude Code casi no requiere configuración, no consume tokens y necesita iniciar sesión con claude.ai. Para usarlo de vez en cuando, basta. Para dictar todo el tiempo en todas las apps, conviene una app de dictado aparte.

Whisper local es para los datos privados. Transcripción de negociaciones con clientes, reuniones internas: todo se queda en tu computadora.


Siguiente lección

→ Edición de video con Claude Code: FFmpeg, DaVinci Resolve MCP, Remotion

La marca se guarda solo en este navegador y no se envía a ningún sitio. Mi progreso