Представь, что ты нанял умного универсального сотрудника. Для большинства задач достаточно дать ему инструкцию — он справится. Для сложных задач — дать папку с документами: пусть читает и отвечает. Но иногда задача настолько специфична, что единственный выход — отправить человека на трёхмесячные курсы переподготовки. Fine-tuning (файн-тюнинг — дообучение модели на специфических данных) — это и есть та самая «переподготовка». Дорого, долго, но потом человек работает на автопилоте в этой теме. В этом уроке разберём: когда этот путь реально нужен, а когда — пустая трата денег.
Суть урока
Большинство разработчиков сразу думают о файн-тюнинге когда AI "не понимает" задачу. Это ошибка. В большинстве случаев проблема решается лучшим промптом или добавлением нужных документов. Файн-тюнинг — инструмент последнего уровня: мощный, дорогой и нужный только в специфических ситуациях.
Этот урок даёт чёткое дерево решений: что выбрать и когда.
Ключевые концепции
- Три уровня настройки AI: от простого к дорогому
- Prompt engineering (промпт-инжиниринг — искусство создания эффективных запросов к AI) — когда хватает
- RAG (рэг, Retrieval-Augmented Generation — генерация с поиском, добавление внешних данных к запросу) — когда нужны документы
- Fine-tuning — когда нужна специализация модели
- Дерево решений: что выбрать для твоей задачи
- Стоимость каждого уровня: порядок величин
Теория
Три уровня настройки AI
Уровень 1 — Дать инструкцию. Ты говоришь: "Пиши посты вот в таком тоне, вот примеры, следуй этим правилам". Большинство сотрудников справятся. Бесплатно, мгновенно.
Уровень 2 — Дать справочник. Сотрудник не знает всей документации компании, но ты даёшь ему доступ к архиву: "Перед ответом клиенту — найди нужный раздел и используй". Требует настройки, стоит денег, но данные живут отдельно.
Уровень 3 — Отправить на курсы специализации. Три месяца обучения только вашей специфике. После этого человек знает всё наизусть, работает быстро. Дорого, долго, но иногда единственный выход.
Промпт-инжиниринг, RAG и файн-тюнинг — это точно такие же три уровня.
Уровень 1: Prompt Engineering — когда хватает
Что это: написание детальных системных промптов, примеров и структуры ответа прямо в запросе к модели.
Когда достаточно:
- Большинство бизнес-задач
- Нужен определённый стиль текста
- Анализ документов, переводы, код по шаблону
- Классификация, резюмирование, вопросы-ответы
Преимущества:
- Стоимость: только время на написание промпта (плюс обычная цена API)
- Изменить можно мгновенно — правишь текст и готово
- Не нужно обучать модель заново
- Гибко: разные задачи — разные промпты
Ограничения:
- Если задача требует знания которого нет в базовой модели
- Если стиль настолько специфичен что его невозможно описать словами
- Если тысячи одинаковых задач и токены на промпт превращаются в большие деньги
Примеры задач где хватает промпта:
- Написание постов в стиле конкретного бренда (описываешь стиль + даёшь 3 примера)
- Анализ договора по чеклисту (чеклист — в промпте)
- Перевод с учётом терминологии (термины — в промпте)
- Генерация кода по шаблону (шаблон — в промпте)
Правило: Всегда начинай с промпта. Добавляй сложность только если промпт не справляется.
Уровень 2: RAG — когда знания устарели или слишком велики
Что это: перед ответом AI самостоятельно ищет в твоей базе знаний релевантные куски текста и добавляет их в контекст запроса.
Как работает технически (без математики):
Вопрос пользователя
↓
Поиск в vectorDB (векторной базе данных — хранилище текстов
в виде числовых векторов, по которым ищут похожее)
↓
Топ-3 релевантных документа найдены
↓
Claude получает: вопрос + найденные куски + отвечает
↓
Ответ с ссылками на источникиКогда нужен RAG:
- Данные часто меняются (цены, законы, внутренние политики компании)
- Большая база документов которую невозможно засунуть в один промпт
- Специфические отраслевые знания которых нет в базовой модели
- Нужно давать ссылки на конкретные источники
- Конфиденциальные данные которые ты не хочешь дублировать в промпте
Инструменты для RAG:
- Gemini Notebook (бывший NotebookLM, переименован в июле 2026) от Google — есть бесплатная версия, загружаешь документы и задаёшь вопросы
- LlamaIndex (ЛамаИндекс) — Python-библиотека для построения RAG-систем
- LangChain (ЛэнгЧейн) — популярный фреймворк (фреймворк — готовый каркас для разработки) для LLM-приложений
- Anthropic Claude с загрузкой документов — встроенная возможность в Claude.ai
Стоимость RAG: зависит от инструмента и объёма данных: от нуля у готовых сервисов до регулярных расходов на vectorDB и compute (вычислительные мощности)
Примеры где RAG работает отлично:
- Корпоративный бот по внутренним документам и политикам
- Юридическая база решений судов: "найди прецеденты по этому вопросу"
- Медицинские протоколы: "какой стандарт лечения для этого диагноза?"
- Клиентская поддержка по продукту: база из 500 статей FAQ (часто задаваемые вопросы)
Уровень 3: Fine-tuning — когда действительно нужна специализация
Что это: переобучение модели на специфическом наборе данных. Модель не просто "помнит" примеры — она физически меняет веса нейросети, то есть меняется внутренняя математика модели.
Когда fine-tuning реально оправдан:
Очень специфический стиль который невозможно описать промптом. Например, тон конкретного автора с тысячами нюансов в выборе слов.
Огромное количество однотипных задач. Если у тебя 100 000 запросов/день одного типа — каждый длинный промпт с инструкциями стоит лишние токены. После файн-тюнинга промпт короче, inference (инференс — скорость и процесс генерации ответа моделью) быстрее.
Конфиденциальные данные. Обучил на локальном железе — данные никуда не уходят.
Специфическая терминология или язык. Медицинские аббревиатуры, юридические формулировки, профессиональный жаргон узкой отрасли.
Нужен быстрый inference с малой моделью. Обученная маленькая модель может работать быстрее и дешевле большой универсальной.
Когда fine-tuning НЕ нужен (частые ошибки):
| Что думает разработчик | Что реально нужно |
|---|---|
| "Хочу чтобы AI знал наши документы" | RAG — это его работа |
| "Модель даёт неправильные ответы" | Улучши промпт |
| "Хочу сохранить контекст разговора" | Память / контекст-менеджмент |
| "Нужен специфический стиль" | 3-5 примеров в промпте |
| "Модель медленно работает" | Выбери более быструю модель |
Как работает fine-tuning технически (без математики)
Шаг 1: Базовая модель. Берёшь готовую обученную модель. Сегодня это обычно открытая модель (семейства Llama, Qwen, Gemma, Mistral) — в зависимости от задачи и бюджета. У закрытых поставщиков такая возможность сворачивается.
Шаг 2: Готовишь dataset (датасет — набор данных для обучения). Пары "вопрос → правильный ответ" или "текст → нужная классификация". Для базового результата нужны десятки примеров, для хорошего — сотни и тысячи; точное число зависит от задачи.
Шаг 3: Запускаешь обучение. Модель смотрит на твои примеры, сравнивает свои ответы с правильными и постепенно корректирует внутренние параметры.
Шаг 4: Получаешь новую версию модели. Та же архитектура — но "наклонённая" в сторону твоих данных. Лучше работает на твоей задаче, хуже — на всём остальном (это нормально).
Главный риск — overfitting (переобучение — когда модель запомнила примеры но не научилась обобщать):
Как избежать: разделить dataset на train/test (обучающая/тестовая выборка), следить за метриками (метриками — числовыми показателями качества) на обеих частях.
PEFT и LoRA — эффективное дообучение без огромных затрат
Проблема полного файн-тюнинга: большая языковая модель имеет миллиарды параметров (параметров — чисел внутри нейросети которые определяют её поведение). Менять их все стоит огромных вычислительных ресурсов.
Решение — PEFT (пэфт, Parameter-Efficient Fine-Tuning — эффективное дообучение с минимумом параметров): меняем не все параметры, а только малую их часть. Качество часто почти такое же — цена намного ниже.
Самый популярный PEFT-метод — LoRA (лора, Low-Rank Adaptation — адаптация низкого ранга):
Вместо изменения всей огромной матрицы параметров — добавляем маленький "слой" сверху. Этот слой обучается на твоих данных. Базовая модель не трогается.
Результат:
- Качество обычно близко к полному файн-тюнингу
- Стоимость во много раз ниже
- Можно переключаться между разными LoRA-адаптерами (адаптерами — добавочными слоями для разных задач) на одной базовой модели
Большинство современных open-source (опен-сорс — программное обеспечение с открытым кодом) файн-тюнинг сервисов используют LoRA под капотом.
Где делать fine-tuning: сравнение провайдеров
Важно на октябрь 2026: крупные поставщики закрытых моделей сворачивают самообслуживаемый fine-tuning. OpenAI уведомила разработчиков об этом в мае 2026: организациям, которые раньше не дообучали модели, создавать задачи обучения нельзя с 7 мая 2026, а существующим клиентам новые задачи закроются 6 января 2027. Дообученные модели gpt-3.5-turbo и gpt-4 отключаются 23 октября 2026. Поэтому для нового проекта надёжнее открытые модели, которые можно дообучать у себя или у провайдера GPU. Условия провайдеров меняются, проверяй их на сайтах.
| Сервис | Модели | Условия | Сложность | Лучше для |
|---|---|---|---|---|
| OpenAI Fine-tuning | Модели OpenAI | Самообслуживаемый fine-tuning сворачивается (даты выше) | — | Для нового проекта не выбирай |
| Anthropic | Claude | Самостоятельного дообучения весов Claude нет; кастомные решения для крупного бизнеса обсуждай с Anthropic напрямую | Enterprise | Крупный бизнес |
| Google Cloud (Vertex AI) | Gemini и другие | Список моделей и условия смотри в документации Google | Высокая | Google-инфраструктура |
| Hugging Face (Хаггинг Фейс) | Llama, Mistral, Qwen, Gemma и др. | Оплата времени GPU, цены зависят от железа | Высокая | Privacy, open source |
| Together AI (Тугезер АИ) | Open source модели | Проверь актуальные условия на сайте | Средняя | Баланс цена/качество |
| Replicate (Репликейт) | Разные | Проверь актуальные условия на сайте | Низкая | Быстрые эксперименты |
Рекомендации:
- Начинающим: сначала убедись, что не хватает промпта и RAG. Если дообучение всё-таки нужно — открытая модель + LoRA через Hugging Face (есть no-code AutoTrain) или другой сервис, где fine-tuning сейчас доступен. Пройди обучающий пример до того, как тратить деньги.
- Privacy важна: Hugging Face + своё железо или арендованный GPU (джипюю — графический процессор, используется для обучения нейросетей) — данные никуда не уходят
- Бюджет ограничен: открытая модель (Llama, Qwen, Gemma, Mistral) + LoRA на арендованном GPU — хорошее соотношение цена/качество
- Enterprise: обсуждай кастомные решения напрямую с поставщиком модели, если бюджет позволяет и без этого не обойтись
Дерево решений: что выбрать?
Хочу чтобы AI лучше справлялся с моей задачей
│
├── Данные меняются часто или объём очень большой?
│ └── ДА → RAG (векторная база данных)
│ (цены, законы, документы компании, FAQ)
│
├── Данные статичны и небольшие (умещаются в промпт)?
│ └── Попробуй сначала prompt engineering
│ │
│ └── Промпт не справляется?
│ │
│ ├── Стиль слишком специфичен для описания?
│ │ └── ДА → Fine-tuning
│ │
│ ├── Специфическая терминология или язык?
│ │ └── ДА → Fine-tuning
│ │
│ ├── 100K+ запросов/день одного типа?
│ │ └── ДА → Fine-tuning (экономия на токенах)
│ │
│ └── НЕТ ни одного из выше →
│ Улучши промпт, добавь больше примеров
│
├── Данные конфиденциальные (нельзя в облако)?
│ └── ДА → Fine-tuning на своём железе
│ (Hugging Face + Llama + LoRA)
│
└── Нужна максимальная скорость / минимальная цена per запрос?
└── ДА → Fine-tuning малой модели
(маленькая обученная модель быстрее большой универсальной)Упрощённое правило для 90% случаев:
Попробовал промпт → не работает
↓
Нужны внешние данные? → RAG
↓
Всё ещё не работает → Fine-tuningСтоимость: порядок величин
Конкретные суммы быстро устаревают и зависят от провайдера, поэтому здесь описан порядок величин. Актуальные цены API смотри на странице Актуальное сейчас и на сайтах провайдеров.
Prompt engineering:
- Стоимость: время на написание хорошего промпта (часы)
- Operational cost: стандартная цена API
RAG:
- Setup: от нуля (готовые сервисы вроде Gemini Notebook) до заметных затрат на разработку
- Ongoing (постоянные расходы): vectorDB, вычисления, цена API
- Время до результата: дни
- Operational cost: стандартная цена API + vectorDB
Fine-tuning (open source, Hugging Face + GPU):
- GPU аренда: почасовая, цена зависит от видеокарты
- Одно обучение: стоит заметно дороже, чем промпт или RAG, и обычно нужно несколько итераций
- Inference: дешёвый (своя инфраструктура) или почти бесплатный (своё железо)
- Время до результата: от нескольких дней (подготовка данных + обучение)
Fine-tuning у закрытых поставщиков: условия быстро меняются (см. таблицу выше), для крупного бизнеса цену и сроки узнавай у поставщика.
Вывод для большинства: начни с промптов (самое дешёвое) → добавь RAG (регулярные расходы) → файн-тюнинг только при реальной бизнес-необходимости (самое дорогое и долгое). Как считать, окупится ли это, учат уроки Сколько стоит клиент и сколько он приносит и Точка безубыточности и запас денег.
Когда fine-tuning реально оправдан: примеры
Колл-центр 10,000 звонков/день:
- Задача: автоматическая классификация тем обращений
- Почему файн-тюнинг: огромный объём → длинный промпт каждый раз дорого; нужна скорость; датасет — транскрипты (транскрипты — текстовые расшифровки аудио) звонков уже есть
- Результат: малая модель работает быстро, дёшево, точно для этой конкретной задачи
Медицинская документация:
- Задача: структурировать выписки врачей, заполнять поля в CRM (система управления отношениями с клиентами)
- Почему файн-тюнинг: специфические медицинские аббревиатуры которых нет в базовой модели; конфиденциальность пациентов; высокая точность критична
- Результат: модель обученная на тысячах реальных выписок работает значительно точнее
Юридическая фирма:
- Задача: анализ договоров, поиск рисковых формулировок
- Почему файн-тюнинг: специфические юридические конструкции российского/латиноамериканского права; нюансы которые не опишешь в промпте; конфиденциальность
- Результат: модель "думает" как опытный юрист этой юрисдикции (юрисдикции — правовой территории)
Игровая студия:
- Задача: диалоги NPC (non-player character — неигровой персонаж, компьютерный герой) с уникальным голосом персонажа
- Почему файн-тюнинг: тысячи диалогов, каждый NPC имеет свой стиль который невозможно описать промптом
- Результат: NPC говорят "в образе" без постоянного большого промпта
Примеры где НЕ нужен файн-тюнинг (а думали что нужен):
- "Хочу чтобы бот знал о нашей компании" → загрузи документы в RAG, Gemini Notebook справится быстро
- "Claude не понимает нашу терминологию" → добавь глоссарий (глоссарий — словарь терминов) в системный промпт
- "Хочу чтобы писал как наш бренд" → 5-10 примеров текстов в промпт + описание стиля
Если ты решил делать fine-tuning: базовый чеклист
Шаг 1: Подготовь датасет
- Формат диалогов в стиле OpenAI: JSONL (формат файла, где каждая строка — JSON-объект), его понимают и многие инструменты для открытых моделей
- Для начала десятки примеров, для хорошего результата — сотни и больше
- Качество важнее количества: мусор на входе — мусор на выходе
- Раздели на train/validation (тренировочную/валидационную) выборки (80/20)
Пример структуры (формат диалога):
{"messages": [
{"role": "system", "content": "Ты менеджер поддержки компании X"},
{"role": "user", "content": "Как получить возврат?"},
{"role": "assistant", "content": "Для возврата напишите на support@x.com..."}
]}Шаг 2: Выбери модель и провайдера
- Начинающим: небольшая открытая модель + LoRA на сервисе с готовым интерфейсом
- Privacy: Hugging Face + открытая модель + LoRA на своём железе
Шаг 3: Запусти обучение
- Hugging Face: через AutoTrain (АутоТрейн) — no-code интерфейс для файн-тюнинга
- Свой GPU или аренда: библиотеки вроде Unsloth для LoRA (см. урок Локальные AI модели)
Шаг 4: Оцени результат
- Сравни с базовой моделью на тестовом датасете
- Тестируй edge cases (эдж кейсы — граничные случаи, нетипичные входные данные)
- Проверь на переобучение: хорошо ли работает на новых данных?
Шаг 5: Итерируй (итерируй — повторяй цикл улучшений)
- Добавь больше примеров если качество недостаточно
- Скорректируй hyperparameters (гиперпараметры — настройки процесса обучения)
- Иногда дешевле улучшить датасет чем обучать дольше
Практика
Задание 1: Определи что нужно твоей задаче
Возьми реальную задачу которую ты сейчас решаешь с Claude. Пройди по дереву решений:
- Напиши задачу одним предложением
- Ответь на вопросы дерева решений выше
- Определи: промпт-инжиниринг / RAG / файн-тюнинг
- Оцени бюджет и время
Задание 2: Попробуй NotebookLM (бесплатный RAG)
Если у тебя есть база знаний (PDF, документы Word, веб-страницы):
- Открой Gemini Notebook (адрес notebook.google, раньше NotebookLM)
- Создай новый Notebook (нотбук — рабочую тетрадь)
- Загрузи 5-10 документов твоей компании или проекта
- Задай вопросы — посмотри как RAG находит ответы из документов
- Сравни качество ответов с базовым Claude без документов
Результат: за 20 минут ты получишь работающий RAG без единой строки кода. Это помогает понять нужен ли тебе файн-тюнинг или RAG уже решает задачу.
Задание 3: Пройди обучающий пример по LoRA (туториал — пошаговое обучение)
Если хочешь попробовать файн-тюнинг:
- Открой обучающие материалы Hugging Face про LoRA и PEFT (huggingface.co/learn и документация библиотеки peft)
- Следуй примеру с sentiment classification (классификация тональности — определение позитивного/негативного/нейтрального текста) на небольшой открытой модели
- Нужно: бесплатный ноутбук вроде Google Colab или аренда GPU на пару часов (цены смотри на сайтах)
- Время: несколько часов вместе с подготовкой данных
Примечание: раньше в этом задании использовался fine-tuning OpenAI, но самообслуживаемый fine-tuning у OpenAI сворачивается (см. таблицу провайдеров выше).
Цель задания — не результат, а понимание процесса. После этого решение "нужен файн-тюнинг или нет" будет осознанным.
Ключевые выводы
- Большинство задач решаются промптом — всегда начинай там. Это дёшево и быстро.
- RAG — второй шаг, когда нужны внешние документы, частообновляемые данные или большие базы знаний. Gemini Notebook можно попробовать бесплатно.
- Fine-tuning — только при реальной необходимости: специфический стиль, конфиденциальность, огромные объёмы однотипных задач, специфический язык/терминология.
- LoRA делает файн-тюнинг доступнее: качество близко к полному обучению при гораздо меньших затратах.
- Для большинства практиков: промпт-инжиниринг + RAG — это всё что нужно на ближайшие годы.
- Дерево решений: Данные меняются часто → RAG. Статичны и не описываются промптом → файн-тюнинг. Иначе → улучши промпт.
Следующий урок
Local AI Agents 2026 — nanoClaude, OpenClaw, Hermes, Qwen-Agent
AI Маяк Академия | Продвинутые техники
Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс