Lo esencial
Escribir los prompts (las instrucciones para la IA) a mano no es la única opción. Hay tres formas de hablarle a Claude Code con la voz: apps de dictado aparte (por ejemplo, Aqua Voice), el modo /voice integrado y Whisper local para quien no quiere mandar audio a la nube. Cuando tienes las manos ocupadas o las ideas llegan más rápido que los dedos, la voz gana.
Conceptos clave
- Aqua Voice: un STT (Speech-to-Text, reconocimiento de voz) especializado, enfocado en términos técnicos
- Modo nativo
/voice: el dictado por voz integrado en Claude Code - Whisper API (OpenAI): transcripción en la nube, de uso general
- Whisper local: transcripción sin enviar nada a la nube
- VoiceMode MCP: Whisper STT + Kokoro TTS (Text-to-Speech, síntesis de voz a partir de texto) para conversar por voz en ambos sentidos
- Dictado en cualquier app: Aqua Voice, Wispr Flow, MacWhisper; hablas y el texto aparece donde está el cursor
Teoría
Aqua Voice: por qué está pensado para desarrolladores
Los asistentes de voz comunes (Siri, el dictado de Google) se equivocan con los términos técnicos:
claude-sonnet-5-5→ "clo soné cinco cinco"npm install -g→ "ene pe eme instal ge"Anthropic API key→ "antrópic a pe i qui" (adivina qué sale)
Aqua Voice está ajustado para términos técnicos, comandos de bash (el lenguaje de comandos de la terminal), nombres de librerías y patrones de código, según sus desarrolladores.
Características (a octubre de 2026, según el sitio del servicio):
| Parámetro | Valor |
|---|---|
| Propósito | Dictado enfocado en términos técnicos |
| Precisión | El servicio declara 97.3% en su propia prueba AISpeak (dato del fabricante, sin verificación independiente) |
| Idiomas | Declara 49; revisa en el sitio que el español esté soportado antes de pagar |
| Integración | System-wide (funciona en todo el sistema) |
| Plataformas | La plataforma principal es macOS; revisa en el sitio si hay otras versiones |
| Precio | Tiene un nivel gratis con un límite de palabras y planes de pago sin límite de palabras; precios vigentes en el sitio |
Alternativas que declaran soporte para español (a octubre de 2026): Wispr Flow (Mac, Windows, iPhone y Android, más de 100 idiomas, nivel gratis con un límite semanal de palabras) y MacWhisper (funciona localmente en Mac, más de 100 idiomas, las funciones básicas son gratis). Catálogo y condiciones vigentes: Herramientas.
Cómo funciona:
- Presionas un atajo de teclado (configurable)
- Hablas y ves la onda de audio en la barra de estado
- Sueltas la tecla → el texto aparece donde está el cursor
- Funciona en VS Code, la Terminal, el navegador y cualquier campo de texto
Instalación:
# Desde el sitio
# aquavoice.com → Get Started on Mac → descargar e instalarPrimera configuración:
- Abre Aqua Voice
- System Settings → Privacy & Security → Microphone → permitir
- Configura el atajo (recomiendo Option+Space o Cmd+Shift+V)
- Elige el modo de trabajo que te convenga (la lista de modos está en la configuración de la app)
El modo nativo /voice en Claude Code
Claude Code tiene dictado por voz integrado, sin apps externas.
Activación:
# En Claude Code escribe /voice # Elige el modo: mantener presionado o presionar dos veces /voice hold /voice tap
Qué hace:
- Modo hold (por defecto): mantienes Space → hablas → sueltas → el texto se inserta en tu solicitud
- Modo tap: presionas Space → hablas → presionas otra vez → la solicitud se envía
- La transcripción está ajustada para términos de programación (regex, OAuth, JSON); el nombre del proyecto y la rama de git se sugieren automáticamente
- Funciona en la CLI de la terminal y en la extensión de VS Code; no funciona en sesiones en la nube ni por SSH
- Requiere iniciar sesión con una cuenta de claude.ai (no con clave de API); la transcripción no consume tokens ni los límites del plan
- El idioma del dictado se toma de la opción
language(/config); por defecto es inglés y el español está soportado: elígelo, o el texto saldrá distorsionado - El audio se envía a los servidores de Anthropic para transcribirlo: para grabaciones confidenciales usa Whisper local
Diferencia con Aqua Voice:
| Parámetro | Modo /voice |
Aqua Voice |
|---|---|---|
| Disponibilidad | Solo en Claude Code (CLI y VS Code) | System-wide (en todas partes) |
| Configuración | /voice y elegir el idioma |
5 minutos |
| Precisión técnica | Ajustada para términos de programación | Declara 97.3% (dato del fabricante) |
| Precio | No consume tokens ni límites del plan | Nivel gratis y planes de pago |
| Personalización | Modos hold/tap, tecla configurable | Atajos, modos |
| Sin conexión | No (el audio va a los servidores de Anthropic) | Revisa en el sitio |
Recomendación: /voice para empezar rápido y usarlo de vez en cuando. Aqua Voice, si la voz se vuelve tu forma principal de escribir.
Whisper API: transcripción en la nube
OpenAI Whisper es un modelo de transcripción muy popular. Por la API se cobra por minuto de audio (el modelo whisper-1). OpenAI también tiene modelos de reconocimiento más nuevos (por ejemplo, gpt-4o-transcribe y gpt-4o-mini-transcribe): revisa los precios vigentes en la página de precios de OpenAI.
Uso con Python (lenguaje de programación):
import openai
import sounddevice as sd
import numpy as np
import scipy.io.wavfile as wav
import tempfile
client = openai.OpenAI() # la clave se toma de la variable de entorno OPENAI_API_KEY
def record_and_transcribe(duration_seconds=10):
"""Graba audio y lo transcribe con Whisper"""
print(f"Grabando {duration_seconds} segundos... (¡habla!)")
# Grabación
sample_rate = 16000
recording = sd.rec(
int(duration_seconds * sample_rate),
samplerate=sample_rate,
channels=1
)
sd.wait()
print("Transcribiendo...")
# Guardamos en un archivo temporal
with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as tmp:
wav.write(tmp.name, sample_rate, recording)
with open(tmp.name, "rb") as audio_file:
transcription = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
language="es" # o "en", o quítalo para que detecte el idioma
)
return transcription.text
# Ejemplo de uso con Claude
import anthropic
claude = anthropic.Anthropic() # la clave se toma de la variable de entorno ANTHROPIC_API_KEY
while True:
user_input = record_and_transcribe(duration_seconds=8)
print(f"Tú: {user_input}")
if "alto" in user_input.lower():
break
response = claude.messages.create(
model="claude-sonnet-5-5",
max_tokens=1000,
messages=[{"role": "user", "content": user_input}]
)
print(f"Claude: {''.join(b.text for b in response.content if b.type == 'text')}")Instalar dependencias:
pip install openai sounddevice scipy numpy anthropicWhisper local: privacidad total
Para tareas en las que no puedes mandar audio a la nube (negociaciones con clientes, datos confidenciales).
# Instalación
pip install openai-whisper ffmpeg-python
# En Mac: brew install ffmpegimport whisper
# Cargamos el modelo (una sola vez, queda en caché)
# tiny=39MB, base=74MB, small=244MB, medium=769MB, large=1.5GB
model = whisper.load_model("small") # equilibrio entre velocidad y calidad
def transcribe_local(audio_path: str, language: str = "es") -> str:
"""Transcribe audio localmente, sin nube"""
result = model.transcribe(
audio_path,
language=language,
fp16=False # fp16=True si tienes GPU
)
return result["text"]
# Ejemplo
text = transcribe_local("grabacion.wav")
print(text)Comparación de modelos de Whisper:
| Modelo | Tamaño | Velocidad (CPU, aproximada) | Calidad |
|---|---|---|---|
| tiny | 39 MB | ~10x tiempo real | Básica |
| base | 74 MB | ~7x tiempo real | Normal |
| small | 244 MB | ~4x tiempo real | Buena |
| medium | 769 MB | ~2x tiempo real | Muy buena |
| large | 1.5 GB | ~1x tiempo real | La mejor |
En Apple Silicon funcionan más rápido las implementaciones optimizadas (por ejemplo, whisper.cpp o la app MacWhisper); el paquete estándar openai-whisper calcula en CPU o GPU.
VoiceMode MCP: voz en ambos sentidos
VoiceMode MCP permite que Claude Code te conteste hablando, no solo que te escuche.
# Instalación como plugin de Claude Code
claude plugin install voicemode@voicemode
/voicemode:install
/voicemode:converse
# Alternativa: instalador en Python
uvx voice-mode-installQué hace:
- STT: Whisper.cpp (local) o la API de OpenAI como respaldo
- TTS: Kokoro TTS (abierto, funciona localmente) o la API de OpenAI
- Integración con Claude Code para conversar por voz
Útil para: programar en pareja con la IA, revisar código en voz alta, dictar documentación.
Escenarios prácticos
Escenario 1: desarrollo por voz
Abres VS Code y activas Aqua Voice
→ Dices: "agrega validación de email a la función de registro"
→ El texto aparece en el chat de Claude Code
→ Claude escribe el código
→ Dices en voz alta la siguiente tareaEscenario 2: diario de voz del desarrollador
#!/usr/bin/env bash
# voice-standup.sh — standup por voz cada mañana
RECORDING_FILE="/tmp/standup-$(date +%Y%m%d).wav"
# Grabamos la voz (90 segundos)
rec -r 16000 -c 1 "$RECORDING_FILE" trim 0 90
# Transcribimos con la Whisper API
TRANSCRIPT=$(curl -s -X POST "https://api.openai.com/v1/audio/transcriptions" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-F file="@$RECORDING_FILE" \
-F model="whisper-1" \
-F language="es" | jq -r '.text')
# Lo estructuramos con Claude
STANDUP=$(echo "$TRANSCRIPT" | claude -p "
Convierte este standup por voz en un formato estructurado:
- Qué hice ayer
- Qué planeo hoy
- Bloqueos
")
# Guardamos
echo "$STANDUP" >> ~/standups/$(date +%Y-%m).md
echo "¡Standup guardado!"Escenario 3: transcribir reuniones con clientes
# Whisper local: el audio no sale a la nube (el texto transcrito sí va después a la API de Claude)
# Graba conversaciones solo con el consentimiento de los participantes
import whisper
import anthropic
model = whisper.load_model("medium")
claude = anthropic.Anthropic()
# Transcribimos la grabación de la reunión
transcript = model.transcribe("meeting-2026-05-09.mp3", language="es")
# Extraemos las tareas con Claude
response = claude.messages.create(
model="claude-sonnet-5-5",
max_tokens=2000,
messages=[{
"role": "user",
"content": f"De esta transcripción de la reunión extrae: "
f"la lista de tareas con responsables, las decisiones clave "
f"y las preguntas sin respuesta.\n\nTranscripción:\n{transcript['text']}"
}]
)
print("".join(b.text for b in response.content if b.type == "text"))Dictado de macOS: alternativa gratuita
La función de dictado integrada en macOS (en muchos casos funciona sin internet; depende del idioma y de la versión de macOS):
System Settings → Keyboard → Dictation → On
Atajo: presionar Fn dos veces (o configurarlo)
Idioma: Spanish (soportado)Ventajas: gratis, a menudo sin conexión, funciona en todas partes Desventajas: se equivoca más con términos técnicos, no tiene API
Práctica
- Activa el dictado de macOS (System Settings → Keyboard) y prueba a dictar un prompt en Claude Code
- Instala y configura Aqua Voice (aquavoice.com) u otra opción de dictado; compara la precisión con términos técnicos
- Crea un script
voice-note.shque grabe una nota de voz y la guarde en un archivo Markdown - (opcional) Conecta VoiceMode MCP para conversar por voz en ambos sentidos
Herramientas y recursos
- Aqua Voice: STT especializado para desarrolladores
- Claude Code: voice dictation: documentación de
/voice - Wispr Flow y MacWhisper: alternativas de dictado, ver el catálogo de Herramientas
- OpenAI Whisper API: transcripción en la nube
- OpenAI Whisper (local): repositorio en GitHub
- VoiceMode MCP: voz en ambos sentidos para Claude
- Kokoro TTS: Text-to-Speech abierto
- Dictado de macOS: System Settings → Keyboard → Dictation
Conclusiones clave
Aqua Voice es una de las opciones de entrada de voz técnica: funciona en todo el sistema y en todas las apps. Revisa en el sitio los precios y el soporte del español.
El modo nativo
/voicede Claude Code casi no requiere configuración, no consume tokens y necesita iniciar sesión con claude.ai. Para usarlo de vez en cuando, basta. Para dictar todo el tiempo en todas las apps, conviene una app de dictado aparte.
Whisper local es para los datos privados. Transcripción de negociaciones con clientes, reuniones internas: todo se queda en tu computadora.
Siguiente lección
→ Edición de video con Claude Code: FFmpeg, DaVinci Resolve MCP, Remotion
La marca se guarda solo en este navegador y no se envía a ningún sitio. Mi progreso