Библиотека · AI на своём компьютере и своём сервере

Fine-tuning — когда промптов мало

Строитель55 минОбновлено: октябрь 2026
77 из 105 в библиотеке

Модуль: 13. Профессиональная практика | Время: ~35 мин теории + 20 мин практики

Представь, что ты нанял умного универсального сотрудника. Для большинства задач достаточно дать ему инструкцию — он справится. Для сложных задач — дать папку с документами: пусть читает и отвечает. Но иногда задача настолько специфична, что единственный выход — отправить человека на трёхмесячные курсы переподготовки. Fine-tuning (файн-тюнинг — дообучение модели на специфических данных) — это и есть та самая «переподготовка». Дорого, долго, но потом человек работает на автопилоте в этой теме. В этом уроке разберём: когда этот путь реально нужен, а когда — пустая трата денег.


Суть урока

Большинство разработчиков сразу думают о файн-тюнинге когда AI "не понимает" задачу. Это ошибка. В большинстве случаев проблема решается лучшим промптом или добавлением нужных документов. Файн-тюнинг — инструмент последнего уровня: мощный, дорогой и нужный только в специфических ситуациях.

Этот урок даёт чёткое дерево решений: что выбрать и когда.


Ключевые концепции

  • Три уровня настройки AI: от простого к дорогому
  • Prompt engineering (промпт-инжиниринг — искусство создания эффективных запросов к AI) — когда хватает
  • RAG (рэг, Retrieval-Augmented Generation — генерация с поиском, добавление внешних данных к запросу) — когда нужны документы
  • Fine-tuning — когда нужна специализация модели
  • Дерево решений: что выбрать для твоей задачи
  • Стоимость каждого уровня: порядок величин

Теория

Три уровня настройки AI

🎨 Образ: Три способа работы с новым сотрудником.

Уровень 1 — Дать инструкцию. Ты говоришь: "Пиши посты вот в таком тоне, вот примеры, следуй этим правилам". Большинство сотрудников справятся. Бесплатно, мгновенно.

Уровень 2 — Дать справочник. Сотрудник не знает всей документации компании, но ты даёшь ему доступ к архиву: "Перед ответом клиенту — найди нужный раздел и используй". Требует настройки, стоит денег, но данные живут отдельно.

Уровень 3 — Отправить на курсы специализации. Три месяца обучения только вашей специфике. После этого человек знает всё наизусть, работает быстро. Дорого, долго, но иногда единственный выход.

Промпт-инжиниринг, RAG и файн-тюнинг — это точно такие же три уровня.


Уровень 1: Prompt Engineering — когда хватает

Что это: написание детальных системных промптов, примеров и структуры ответа прямо в запросе к модели.

Когда достаточно:

  • Большинство бизнес-задач
  • Нужен определённый стиль текста
  • Анализ документов, переводы, код по шаблону
  • Классификация, резюмирование, вопросы-ответы

Преимущества:

  • Стоимость: только время на написание промпта (плюс обычная цена API)
  • Изменить можно мгновенно — правишь текст и готово
  • Не нужно обучать модель заново
  • Гибко: разные задачи — разные промпты

Ограничения:

  • Если задача требует знания которого нет в базовой модели
  • Если стиль настолько специфичен что его невозможно описать словами
  • Если тысячи одинаковых задач и токены на промпт превращаются в большие деньги

Примеры задач где хватает промпта:

  • Написание постов в стиле конкретного бренда (описываешь стиль + даёшь 3 примера)
  • Анализ договора по чеклисту (чеклист — в промпте)
  • Перевод с учётом терминологии (термины — в промпте)
  • Генерация кода по шаблону (шаблон — в промпте)

🎨 Образ: Инструктаж перед сменой. Менеджер говорит сотруднику: "Вот правила, вот примеры как делали раньше, делай вот так". Для большинства стандартных задач этого достаточно. Если сотрудник умный — справится.

Правило: Всегда начинай с промпта. Добавляй сложность только если промпт не справляется.


Уровень 2: RAG — когда знания устарели или слишком велики

Что это: перед ответом AI самостоятельно ищет в твоей базе знаний релевантные куски текста и добавляет их в контекст запроса.

Как работает технически (без математики):

Код
Вопрос пользователя
       ↓
Поиск в vectorDB (векторной базе данных — хранилище текстов
в виде числовых векторов, по которым ищут похожее)
       ↓
Топ-3 релевантных документа найдены
       ↓
Claude получает: вопрос + найденные куски + отвечает
       ↓
Ответ с ссылками на источники

Когда нужен RAG:

  • Данные часто меняются (цены, законы, внутренние политики компании)
  • Большая база документов которую невозможно засунуть в один промпт
  • Специфические отраслевые знания которых нет в базовой модели
  • Нужно давать ссылки на конкретные источники
  • Конфиденциальные данные которые ты не хочешь дублировать в промпте

Инструменты для RAG:

  • Gemini Notebook (бывший NotebookLM, переименован в июле 2026) от Google — есть бесплатная версия, загружаешь документы и задаёшь вопросы
  • LlamaIndex (ЛамаИндекс) — Python-библиотека для построения RAG-систем
  • LangChain (ЛэнгЧейн) — популярный фреймворк (фреймворк — готовый каркас для разработки) для LLM-приложений
  • Anthropic Claude с загрузкой документов — встроенная возможность в Claude.ai

Стоимость RAG: зависит от инструмента и объёма данных: от нуля у готовых сервисов до регулярных расходов на vectorDB и compute (вычислительные мощности)

Примеры где RAG работает отлично:

  • Корпоративный бот по внутренним документам и политикам
  • Юридическая база решений судов: "найди прецеденты по этому вопросу"
  • Медицинские протоколы: "какой стандарт лечения для этого диагноза?"
  • Клиентская поддержка по продукту: база из 500 статей FAQ (часто задаваемые вопросы)

🎨 Образ: Умный секретарь с огромным архивом. Ты задаёшь вопрос → секретарь идёт в архив, находит нужные папки → читает тебе вслух релевантное → ты принимаешь решение. Секретарь не знает всё наизусть — но знает где искать.


Уровень 3: Fine-tuning — когда действительно нужна специализация

Что это: переобучение модели на специфическом наборе данных. Модель не просто "помнит" примеры — она физически меняет веса нейросети, то есть меняется внутренняя математика модели.

Когда fine-tuning реально оправдан:

  1. Очень специфический стиль который невозможно описать промптом. Например, тон конкретного автора с тысячами нюансов в выборе слов.

  2. Огромное количество однотипных задач. Если у тебя 100 000 запросов/день одного типа — каждый длинный промпт с инструкциями стоит лишние токены. После файн-тюнинга промпт короче, inference (инференс — скорость и процесс генерации ответа моделью) быстрее.

  3. Конфиденциальные данные. Обучил на локальном железе — данные никуда не уходят.

  4. Специфическая терминология или язык. Медицинские аббревиатуры, юридические формулировки, профессиональный жаргон узкой отрасли.

  5. Нужен быстрый inference с малой моделью. Обученная маленькая модель может работать быстрее и дешевле большой универсальной.

Когда fine-tuning НЕ нужен (частые ошибки):

Что думает разработчик Что реально нужно
"Хочу чтобы AI знал наши документы" RAG — это его работа
"Модель даёт неправильные ответы" Улучши промпт
"Хочу сохранить контекст разговора" Память / контекст-менеджмент
"Нужен специфический стиль" 3-5 примеров в промпте
"Модель медленно работает" Выбери более быструю модель

🎨 Образ: Файн-тюнинг — как нанять человека и обучить его три месяца ТОЛЬКО вашей специфике. После обучения он знает всё наизусть, работает быстро, не нужно каждый раз объяснять контекст. Но это дорого, долго, и если специфика изменилась — нужно переобучать.


Как работает fine-tuning технически (без математики)

Шаг 1: Базовая модель. Берёшь готовую обученную модель. Сегодня это обычно открытая модель (семейства Llama, Qwen, Gemma, Mistral) — в зависимости от задачи и бюджета. У закрытых поставщиков такая возможность сворачивается.

Шаг 2: Готовишь dataset (датасет — набор данных для обучения). Пары "вопрос → правильный ответ" или "текст → нужная классификация". Для базового результата нужны десятки примеров, для хорошего — сотни и тысячи; точное число зависит от задачи.

Шаг 3: Запускаешь обучение. Модель смотрит на твои примеры, сравнивает свои ответы с правильными и постепенно корректирует внутренние параметры.

Шаг 4: Получаешь новую версию модели. Та же архитектура — но "наклонённая" в сторону твоих данных. Лучше работает на твоей задаче, хуже — на всём остальном (это нормально).

Главный риск — overfitting (переобучение — когда модель запомнила примеры но не научилась обобщать):

🎨 Образ: Натренировал собаку делать команду "сидеть" только дома. На улице — не слушается. Модель запомнила твои конкретные примеры, но не научилась работать с новыми похожими случаями. Признак переобучения: на тренировочных данных работает отлично, на новых — плохо.

Как избежать: разделить dataset на train/test (обучающая/тестовая выборка), следить за метриками (метриками — числовыми показателями качества) на обеих частях.


PEFT и LoRA — эффективное дообучение без огромных затрат

Проблема полного файн-тюнинга: большая языковая модель имеет миллиарды параметров (параметров — чисел внутри нейросети которые определяют её поведение). Менять их все стоит огромных вычислительных ресурсов.

Решение — PEFT (пэфт, Parameter-Efficient Fine-Tuning — эффективное дообучение с минимумом параметров): меняем не все параметры, а только малую их часть. Качество часто почти такое же — цена намного ниже.

Самый популярный PEFT-метод — LoRA (лора, Low-Rank Adaptation — адаптация низкого ранга):

Вместо изменения всей огромной матрицы параметров — добавляем маленький "слой" сверху. Этот слой обучается на твоих данных. Базовая модель не трогается.

Результат:

  • Качество обычно близко к полному файн-тюнингу
  • Стоимость во много раз ниже
  • Можно переключаться между разными LoRA-адаптерами (адаптерами — добавочными слоями для разных задач) на одной базовой модели

🎨 Образ: LoRA как специфический акцент в речи. Ты не учишь человека заново говорить по-английски — ты добавляешь поверх специфические речевые паттерны (паттерны — устойчивые шаблоны поведения). Акцент меняет подачу, не меняя базовый язык.

Большинство современных open-source (опен-сорс — программное обеспечение с открытым кодом) файн-тюнинг сервисов используют LoRA под капотом.


Где делать fine-tuning: сравнение провайдеров

Важно на октябрь 2026: крупные поставщики закрытых моделей сворачивают самообслуживаемый fine-tuning. OpenAI уведомила разработчиков об этом в мае 2026: организациям, которые раньше не дообучали модели, создавать задачи обучения нельзя с 7 мая 2026, а существующим клиентам новые задачи закроются 6 января 2027. Дообученные модели gpt-3.5-turbo и gpt-4 отключаются 23 октября 2026. Поэтому для нового проекта надёжнее открытые модели, которые можно дообучать у себя или у провайдера GPU. Условия провайдеров меняются, проверяй их на сайтах.

Сервис Модели Условия Сложность Лучше для
OpenAI Fine-tuning Модели OpenAI Самообслуживаемый fine-tuning сворачивается (даты выше) — Для нового проекта не выбирай
Anthropic Claude Самостоятельного дообучения весов Claude нет; кастомные решения для крупного бизнеса обсуждай с Anthropic напрямую Enterprise Крупный бизнес
Google Cloud (Vertex AI) Gemini и другие Список моделей и условия смотри в документации Google Высокая Google-инфраструктура
Hugging Face (Хаггинг Фейс) Llama, Mistral, Qwen, Gemma и др. Оплата времени GPU, цены зависят от железа Высокая Privacy, open source
Together AI (Тугезер АИ) Open source модели Проверь актуальные условия на сайте Средняя Баланс цена/качество
Replicate (Репликейт) Разные Проверь актуальные условия на сайте Низкая Быстрые эксперименты

Рекомендации:

  • Начинающим: сначала убедись, что не хватает промпта и RAG. Если дообучение всё-таки нужно — открытая модель + LoRA через Hugging Face (есть no-code AutoTrain) или другой сервис, где fine-tuning сейчас доступен. Пройди обучающий пример до того, как тратить деньги.
  • Privacy важна: Hugging Face + своё железо или арендованный GPU (джипюю — графический процессор, используется для обучения нейросетей) — данные никуда не уходят
  • Бюджет ограничен: открытая модель (Llama, Qwen, Gemma, Mistral) + LoRA на арендованном GPU — хорошее соотношение цена/качество
  • Enterprise: обсуждай кастомные решения напрямую с поставщиком модели, если бюджет позволяет и без этого не обойтись

Дерево решений: что выбрать?

Код
Хочу чтобы AI лучше справлялся с моей задачей
│
├── Данные меняются часто или объём очень большой?
│   └── ДА → RAG (векторная база данных)
│              (цены, законы, документы компании, FAQ)
│
├── Данные статичны и небольшие (умещаются в промпт)?
│   └── Попробуй сначала prompt engineering
│       │
│       └── Промпт не справляется?
│           │
│           ├── Стиль слишком специфичен для описания?
│           │   └── ДА → Fine-tuning
│           │
│           ├── Специфическая терминология или язык?
│           │   └── ДА → Fine-tuning
│           │
│           ├── 100K+ запросов/день одного типа?
│           │   └── ДА → Fine-tuning (экономия на токенах)
│           │
│           └── НЕТ ни одного из выше →
│               Улучши промпт, добавь больше примеров
│
├── Данные конфиденциальные (нельзя в облако)?
│   └── ДА → Fine-tuning на своём железе
│              (Hugging Face + Llama + LoRA)
│
└── Нужна максимальная скорость / минимальная цена per запрос?
    └── ДА → Fine-tuning малой модели
               (маленькая обученная модель быстрее большой универсальной)

Упрощённое правило для 90% случаев:

Код
Попробовал промпт → не работает
       ↓
Нужны внешние данные? → RAG
       ↓
Всё ещё не работает → Fine-tuning

Стоимость: порядок величин

Конкретные суммы быстро устаревают и зависят от провайдера, поэтому здесь описан порядок величин. Актуальные цены API смотри на странице Актуальное сейчас и на сайтах провайдеров.

Prompt engineering:

  • Стоимость: время на написание хорошего промпта (часы)
  • Operational cost: стандартная цена API

RAG:

  • Setup: от нуля (готовые сервисы вроде Gemini Notebook) до заметных затрат на разработку
  • Ongoing (постоянные расходы): vectorDB, вычисления, цена API
  • Время до результата: дни
  • Operational cost: стандартная цена API + vectorDB

Fine-tuning (open source, Hugging Face + GPU):

  • GPU аренда: почасовая, цена зависит от видеокарты
  • Одно обучение: стоит заметно дороже, чем промпт или RAG, и обычно нужно несколько итераций
  • Inference: дешёвый (своя инфраструктура) или почти бесплатный (своё железо)
  • Время до результата: от нескольких дней (подготовка данных + обучение)

Fine-tuning у закрытых поставщиков: условия быстро меняются (см. таблицу выше), для крупного бизнеса цену и сроки узнавай у поставщика.

Вывод для большинства: начни с промптов (самое дешёвое) → добавь RAG (регулярные расходы) → файн-тюнинг только при реальной бизнес-необходимости (самое дорогое и долгое). Как считать, окупится ли это, учат уроки Сколько стоит клиент и сколько он приносит и Точка безубыточности и запас денег.


Когда fine-tuning реально оправдан: примеры

Колл-центр 10,000 звонков/день:

  • Задача: автоматическая классификация тем обращений
  • Почему файн-тюнинг: огромный объём → длинный промпт каждый раз дорого; нужна скорость; датасет — транскрипты (транскрипты — текстовые расшифровки аудио) звонков уже есть
  • Результат: малая модель работает быстро, дёшево, точно для этой конкретной задачи

Медицинская документация:

  • Задача: структурировать выписки врачей, заполнять поля в CRM (система управления отношениями с клиентами)
  • Почему файн-тюнинг: специфические медицинские аббревиатуры которых нет в базовой модели; конфиденциальность пациентов; высокая точность критична
  • Результат: модель обученная на тысячах реальных выписок работает значительно точнее

Юридическая фирма:

  • Задача: анализ договоров, поиск рисковых формулировок
  • Почему файн-тюнинг: специфические юридические конструкции российского/латиноамериканского права; нюансы которые не опишешь в промпте; конфиденциальность
  • Результат: модель "думает" как опытный юрист этой юрисдикции (юрисдикции — правовой территории)

Игровая студия:

  • Задача: диалоги NPC (non-player character — неигровой персонаж, компьютерный герой) с уникальным голосом персонажа
  • Почему файн-тюнинг: тысячи диалогов, каждый NPC имеет свой стиль который невозможно описать промптом
  • Результат: NPC говорят "в образе" без постоянного большого промпта

Примеры где НЕ нужен файн-тюнинг (а думали что нужен):

  • "Хочу чтобы бот знал о нашей компании" → загрузи документы в RAG, Gemini Notebook справится быстро
  • "Claude не понимает нашу терминологию" → добавь глоссарий (глоссарий — словарь терминов) в системный промпт
  • "Хочу чтобы писал как наш бренд" → 5-10 примеров текстов в промпт + описание стиля

Если ты решил делать fine-tuning: базовый чеклист

Шаг 1: Подготовь датасет

  • Формат диалогов в стиле OpenAI: JSONL (формат файла, где каждая строка — JSON-объект), его понимают и многие инструменты для открытых моделей
  • Для начала десятки примеров, для хорошего результата — сотни и больше
  • Качество важнее количества: мусор на входе — мусор на выходе
  • Раздели на train/validation (тренировочную/валидационную) выборки (80/20)

Пример структуры (формат диалога):

json
{"messages": [
  {"role": "system", "content": "Ты менеджер поддержки компании X"},
  {"role": "user", "content": "Как получить возврат?"},
  {"role": "assistant", "content": "Для возврата напишите на support@x.com..."}
]}

Шаг 2: Выбери модель и провайдера

  • Начинающим: небольшая открытая модель + LoRA на сервисе с готовым интерфейсом
  • Privacy: Hugging Face + открытая модель + LoRA на своём железе

Шаг 3: Запусти обучение

  • Hugging Face: через AutoTrain (АутоТрейн) — no-code интерфейс для файн-тюнинга
  • Свой GPU или аренда: библиотеки вроде Unsloth для LoRA (см. урок Локальные AI модели)

Шаг 4: Оцени результат

  • Сравни с базовой моделью на тестовом датасете
  • Тестируй edge cases (эдж кейсы — граничные случаи, нетипичные входные данные)
  • Проверь на переобучение: хорошо ли работает на новых данных?

Шаг 5: Итерируй (итерируй — повторяй цикл улучшений)

  • Добавь больше примеров если качество недостаточно
  • Скорректируй hyperparameters (гиперпараметры — настройки процесса обучения)
  • Иногда дешевле улучшить датасет чем обучать дольше

Практика

Задание 1: Определи что нужно твоей задаче

Возьми реальную задачу которую ты сейчас решаешь с Claude. Пройди по дереву решений:

  1. Напиши задачу одним предложением
  2. Ответь на вопросы дерева решений выше
  3. Определи: промпт-инжиниринг / RAG / файн-тюнинг
  4. Оцени бюджет и время

Задание 2: Попробуй NotebookLM (бесплатный RAG)

Если у тебя есть база знаний (PDF, документы Word, веб-страницы):

  1. Открой Gemini Notebook (адрес notebook.google, раньше NotebookLM)
  2. Создай новый Notebook (нотбук — рабочую тетрадь)
  3. Загрузи 5-10 документов твоей компании или проекта
  4. Задай вопросы — посмотри как RAG находит ответы из документов
  5. Сравни качество ответов с базовым Claude без документов

Результат: за 20 минут ты получишь работающий RAG без единой строки кода. Это помогает понять нужен ли тебе файн-тюнинг или RAG уже решает задачу.

Задание 3: Пройди обучающий пример по LoRA (туториал — пошаговое обучение)

Если хочешь попробовать файн-тюнинг:

  1. Открой обучающие материалы Hugging Face про LoRA и PEFT (huggingface.co/learn и документация библиотеки peft)
  2. Следуй примеру с sentiment classification (классификация тональности — определение позитивного/негативного/нейтрального текста) на небольшой открытой модели
  3. Нужно: бесплатный ноутбук вроде Google Colab или аренда GPU на пару часов (цены смотри на сайтах)
  4. Время: несколько часов вместе с подготовкой данных

Примечание: раньше в этом задании использовался fine-tuning OpenAI, но самообслуживаемый fine-tuning у OpenAI сворачивается (см. таблицу провайдеров выше).

Цель задания — не результат, а понимание процесса. После этого решение "нужен файн-тюнинг или нет" будет осознанным.


Ключевые выводы

  • Большинство задач решаются промптом — всегда начинай там. Это дёшево и быстро.
  • RAG — второй шаг, когда нужны внешние документы, частообновляемые данные или большие базы знаний. Gemini Notebook можно попробовать бесплатно.
  • Fine-tuning — только при реальной необходимости: специфический стиль, конфиденциальность, огромные объёмы однотипных задач, специфический язык/терминология.
  • LoRA делает файн-тюнинг доступнее: качество близко к полному обучению при гораздо меньших затратах.
  • Для большинства практиков: промпт-инжиниринг + RAG — это всё что нужно на ближайшие годы.
  • Дерево решений: Данные меняются часто → RAG. Статичны и не описываются промптом → файн-тюнинг. Иначе → улучши промпт.

Следующий урок

Local AI Agents 2026 — nanoClaude, OpenClaw, Hermes, Qwen-Agent


AI Маяк Академия | Продвинутые техники

Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс