Библиотека · Приёмы опытных

Голосовые инструменты — Aqua Voice, /voice режим, Whisper

Уверенный пользователь40 минОбновлено: октябрь 2026
48 из 105 в библиотеке

Время: ~20 мин теории + 20 мин практики


Суть урока

Печатать промпты (запросы к AI) вручную — не единственный способ. Есть три способа говорить с Claude Code голосом: отдельные приложения для диктовки (например, Aqua Voice), встроенный /voice режим и локальный Whisper для тех кто не хочет отправлять аудио в облако. Когда руки заняты или мысли приходят быстрее пальцев — голос выигрывает.

🎨 Образ: голосовой ввод в Claude Code — как диктовать письмо секретарю. Ты говоришь, он записывает. Разница — секретарь стоит зарплату, а программа для диктовки стоит подписку или вообще ничего. И не устаёт.


Ключевые концепции

  • Aqua Voice — специализированный STT (эс-ти-ти, Speech-to-Text — распознавание речи) с фокусом на технические термины
  • Native /voice режим — встроенная голосовая диктовка Claude Code
  • Whisper API (эй-пи-ай — интерфейс программирования) (OpenAI) — облачная транскрибация, универсальная
  • Локальный Whisper — транскрибация без отправки в облако
  • VoiceMode MCP (эм-си-пи — протокол контекста модели) — Whisper STT + Kokoro TTS (ти-ти-эс, Text-to-Speech — синтез речи из текста) для двусторонней голосовой коммуникации
  • Диктовка в любом приложении — Aqua Voice, Wispr Flow, MacWhisper: говоришь, текст вставляется туда, где стоит курсор

Теория

Aqua Voice: почему именно для разработчиков

Обычные голосовые ассистенты (Siri, Google Dictation) плохо справляются с техническими терминами:

  • claude-sonnet-5-5 → "клод сонет файв файв"
  • npm install -g → "эн пи эм инсталл джи"
  • Anthropic API key → "антропик эйпиай кей" (угадай как)

🎨 Образ: обычный диктофон — как переводчик который знает только бытовые слова. Хорош для покупок, но в суде — провал. Aqua Voice — как переводчик который жил три года в Silicon Valley и знает всю техническую лексику.

Aqua Voice настроен на технические термины, команды bash (баш — язык команд терминала), названия библиотек и паттерны кода — по заявлению разработчиков.

Характеристики (на октябрь 2026, по сайту сервиса):

Параметр Значение
Назначение Диктовка с фокусом на технические термины
Точность Сервис заявляет 97.3% на собственном тесте AISpeak (данные производителя, независимо не проверены)
Языки Заявлено 49; поддержку русского проверь на сайте перед покупкой
Интеграция System-wide (работает везде)
Платформы Основная платформа macOS; наличие других версий смотри на сайте
Цена Есть бесплатный уровень с лимитом слов и платные планы с безлимитом слов; актуальные цены на сайте

Альтернативы с заявленной поддержкой русского (на октябрь 2026): Wispr Flow (Mac, Windows, iPhone и Android, 100+ языков, бесплатный уровень с недельным лимитом слов) и MacWhisper (работает локально на Mac, 100+ языков, основные функции бесплатны). Каталог и актуальные условия: Инструменты.

Как работает:

  1. Нажал горячую клавишу (настраивается)
  2. Говоришь — видишь waveform в статус-баре
  3. Отпустил клавишу → текст вставляется куда стоит курсор
  4. Работает в VS Code, Terminal, браузере, любом поле ввода

Установка:

bash
# Через сайт
# aquavoice.com → Get Started on Mac → скачать и установить

Первая настройка:

  1. Запустить Aqua Voice
  2. System Settings → Privacy & Security → Microphone → разрешить
  3. Настроить горячую клавишу (рекомендую Option+Space или Cmd+Shift+V)
  4. Выбрать режим работы под свои задачи (список режимов смотри в настройках приложения)

Native /voice режим в Claude Code

В Claude Code есть встроенная голосовая диктовка — без сторонних приложений.

🎨 Образ: раньше нужно было подключать внешний микрофон через адаптер. Теперь микрофон встроен — просто открываешь и говоришь.

Активация:

Напиши в чат
# В Claude Code написать
/voice

# Выбрать режим: удержание клавиши или нажатие-нажатие
/voice hold
/voice tap

Что умеет:

  • Режим hold (по умолчанию): держишь Space → говоришь → отпускаешь → текст вставляется в запрос
  • Режим tap: нажал Space → говоришь → нажал ещё раз → запрос отправлен
  • Расшифровка настроена на термины программирования (regex, OAuth, JSON), название проекта и ветки git подсказываются автоматически
  • Работает в терминальном CLI и в расширении VS Code; не работает в облачных сессиях и по SSH
  • Нужен вход через аккаунт claude.ai (не по API-ключу); расшифровка не расходует токены и лимиты тарифа
  • Язык диктовки берётся из настройки language (/config); по умолчанию английский, русский поддерживается: выбери его, иначе текст получится искажённым
  • Аудио отправляется на серверы Anthropic для расшифровки: для конфиденциальных записей используй локальный Whisper

Отличие от Aqua Voice:

Параметр /voice режим Aqua Voice
Доступность Только в Claude Code (CLI и VS Code) System-wide (везде)
Настройка /voice и выбор языка 5 минут
Техническая точность Настроена на термины программирования Заявлено 97.3% (данные производителя)
Цена Не расходует токены и лимиты тарифа Бесплатный уровень и платные планы
Кастомизация Режимы hold/tap, настраиваемая клавиша Горячие клавиши, режимы
Офлайн Нет (аудио уходит на серверы Anthropic) Уточни на сайте

Рекомендация: /voice для быстрого старта и случайного использования. Aqua Voice — если голосовой ввод станет основным.


Whisper API: облачная транскрибация

OpenAI Whisper — популярная модель транскрибации. Через API она доступна как модель whisper-1, оплата идёт за минуту аудио. У OpenAI есть и более новые модели распознавания (например, gpt-4o-transcribe и gpt-4o-mini-transcribe): актуальные цены смотри на странице цен OpenAI.

🎨 Образ: Whisper — как опытный судебный переводчик. Точный, многоязычный, работает с записями разного качества. Но каждый раз нужно отправлять ему запись в облако.

Использование через Python (Питон — язык программирования):

python
import openai
import sounddevice as sd
import numpy as np
import scipy.io.wavfile as wav
import tempfile

client = openai.OpenAI()  # ключ берётся из переменной окружения OPENAI_API_KEY

def record_and_transcribe(duration_seconds=10):
    """Записывает аудио и транскрибирует через Whisper"""
    print(f"Запись {duration_seconds} секунд... (говорите!)")
    
    # Запись
    sample_rate = 16000
    recording = sd.rec(
        int(duration_seconds * sample_rate),
        samplerate=sample_rate,
        channels=1
    )
    sd.wait()
    
    print("Транскрибирую...")
    
    # Сохраняем во временный файл
    with tempfile.NamedTemporaryFile(suffix=".wav", delete=False) as tmp:
        wav.write(tmp.name, sample_rate, recording)
        
        with open(tmp.name, "rb") as audio_file:
            transcription = client.audio.transcriptions.create(
                model="whisper-1",
                file=audio_file,
                language="ru"  # или "en", или убрать для автодетекта
            )
    
    return transcription.text

# Пример использования с Claude
import anthropic

claude = anthropic.Anthropic()  # ключ берётся из переменной окружения ANTHROPIC_API_KEY

while True:
    user_input = record_and_transcribe(duration_seconds=8)
    print(f"Вы: {user_input}")
    
    if "стоп" in user_input.lower():
        break
    
    response = claude.messages.create(
        model="claude-sonnet-5-5",
        max_tokens=1000,
        messages=[{"role": "user", "content": user_input}]
    )
    
    print(f"Claude: {''.join(b.text for b in response.content if b.type == 'text')}")

Установка зависимостей:

bash
pip install openai sounddevice scipy numpy anthropic

Локальный Whisper: полная приватность

Для задач где нельзя отправлять аудио в облако (клиентские переговоры, конфиденциальные данные).

🎨 Образ: локальный Whisper — как нанять переводчика, который приходит к тебе домой и даёт подписку о неразглашении. Медленнее, чем облако, но всё остаётся у тебя.

bash
# Установка
pip install openai-whisper ffmpeg-python
# На Mac: brew install ffmpeg
python
import whisper

# Загружаем модель (один раз, кешируется)
# tiny=39MB, base=74MB, small=244MB, medium=769MB, large=1.5GB
model = whisper.load_model("small")  # баланс скорость/качество

def transcribe_local(audio_path: str, language: str = "ru") -> str:
    """Транскрибирует аудио локально без облака"""
    result = model.transcribe(
        audio_path,
        language=language,
        fp16=False  # fp16=True если есть GPU
    )
    return result["text"]

# Пример
text = transcribe_local("запись.wav")
print(text)

Сравнение моделей Whisper:

Модель Размер Скорость (CPU, ориентировочно) Качество
tiny 39 МБ ~10x реального времени Базовое
base 74 МБ ~7x реального времени Нормальное
small 244 МБ ~4x реального времени Хорошее
medium 769 МБ ~2x реального времени Очень хорошее
large 1.5 ГБ ~1x реального времени Лучшее

На Apple Silicon быстрее работают оптимизированные реализации (например, whisper.cpp или приложение MacWhisper); стандартный пакет openai-whisper считает на CPU или GPU.


VoiceMode MCP: двусторонний голос

VoiceMode MCP позволяет Claude Code говорить в ответ — не только слышать.

🎨 Образ: без VoiceMode — разговор через стеклянную стену. Ты говоришь, он отвечает текстом. С VoiceMode — нормальный разговор вслух, как с коллегой.

bash
# Установка через плагин Claude Code
claude plugin install voicemode@voicemode
/voicemode:install
/voicemode:converse

# Альтернатива: установщик на Python
uvx voice-mode-install

Что делает:

  • STT: Whisper.cpp (локально) или API OpenAI как запасной вариант
  • TTS: Kokoro TTS (открытый, работает локально) или API OpenAI
  • Интеграция с Claude Code для голосового диалога

Полезно для: парного программирования с AI, code review вслух, диктовки документации.


Практические сценарии

Сценарий 1: Голосовая разработка

Код
Открыл VS Code, включил Aqua Voice
→ Говоришь: "добавь валидацию email в функцию регистрации"
→ Текст вставляется в чат Claude Code
→ Claude пишет код
→ Повторяешь голосом следующую задачу

Сценарий 2: Голосовой дневник разработчика

bash
#!/usr/bin/env bash
# voice-standup.sh — голосовой стендап каждое утро

RECORDING_FILE="/tmp/standup-$(date +%Y%m%d).wav"

# Записываем голос (90 секунд)
rec -r 16000 -c 1 "$RECORDING_FILE" trim 0 90

# Транскрибируем через Whisper API
TRANSCRIPT=$(curl -s -X POST "https://api.openai.com/v1/audio/transcriptions" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F file="@$RECORDING_FILE" \
  -F model="whisper-1" \
  -F language="ru" | jq -r '.text')

# Структурируем через Claude
STANDUP=$(echo "$TRANSCRIPT" | claude -p "
Преобразуй этот голосовой стендап в структурированный формат:
- Что сделал вчера
- Что планирую сегодня  
- Блокеры
")

# Сохраняем
echo "$STANDUP" >> ~/standups/$(date +%Y-%m).md
echo "Стендап записан!"

Сценарий 3: Транскрибация клиентских переговоров

python
# Локальный Whisper — аудио не уходит в облако (текст транскрибации дальше уходит в Claude API)
# Записывай разговоры только с согласия участников
import whisper
import anthropic

model = whisper.load_model("medium")
claude = anthropic.Anthropic()

# Транскрибируем запись встречи
transcript = model.transcribe("meeting-2026-05-09.mp3", language="ru")

# Извлекаем задачи через Claude
response = claude.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=2000,
    messages=[{
        "role": "user",
        "content": f"Из этой транскрибации встречи извлеки: "
                   f"список задач с ответственными, ключевые решения, "
                   f"вопросы без ответа.\n\nТранскрибация:\n{transcript['text']}"
    }]
)

print("".join(b.text for b in response.content if b.type == "text"))

macOS Dictation: бесплатная альтернатива

Встроенная в macOS функция диктовки (во многих случаях работает без интернета, это зависит от языка и версии macOS):

Код
System Settings → Keyboard → Dictation → On
Горячая клавиша: дважды нажать Fn (или настроить)
Язык: Russian (поддерживается)

Плюсы: бесплатно, часто офлайн, работает везде Минусы: хуже справляется с техническими терминами, нет API


Практика

  1. Включи macOS Dictation (System Settings → Keyboard) — попробуй голосом написать промпт в Claude Code
  2. Установи и настрой Aqua Voice (aquavoice.com) или другой вариант диктовки — сравни точность на технических терминах
  3. Создай скрипт voice-note.sh который записывает заметку голосом и сохраняет в Markdown файл
  4. (опционально) Подключи VoiceMode MCP для двустороннего голосового диалога

Инструменты и ресурсы


Ключевые выводы

Aqua Voice — один из вариантов технического голосового ввода: работает system-wide во всех приложениях. Цены и поддержку русского проверяй на сайте.

Native /voice режим в Claude Code — почти нулевая настройка, не расходует токены, нужен вход через claude.ai. Для случайного использования — достаточно. Для постоянного ввода во всех приложениях — отдельное приложение для диктовки.

Локальный Whisper — для приватных данных. Транскрибация клиентских переговоров, внутренних встреч — всё остаётся на твоей машине.


Следующий урок

→ Видеомонтаж через Claude Code — FFmpeg, DaVinci Resolve MCP, Remotion

Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс