TGViewer
Случайный Лес | AI-автоматизация без хайпа Случайный Лес | AI-автоматизация без хайпа @cialesai · 454 subscribers
Post #43 102
Как обучаются модели? И почему вам, скорее всего, не нужно их обучать

Раз в пару недель приходит запрос: «хотим обучить нейросеть на наших данных». Почти всегда через полчаса разговора выясняется, что обучать ничего не надо.

Вот четыре ступени - от дешёвой к дорогой.

1️⃣ Промпт
Вы объясняете модели задачу обычным текстом. Ноль рублей, пять минут. Звучит несерьёзно, но на этом уровне закрывается больше половины рабочих задач.

2️⃣ Примеры в промпте
К инструкции добавляете несколько готовых образцов: вот входные данные, вот правильный ответ. Модель подхватывает формат, структуру и тон.
Так мы делали генерацию писем. Взяли прошлую переписку клиента, положили прямо в промпт - модель начала писать его языком, с его аргументацией и порядком блоков. Никакого обучения, два дня работы.

3️⃣ RAG - подключение базы знаний
Модель не переучивается. Она получает доступ к вашим документам и перед ответом находит в них нужный фрагмент.
Триста страниц регламентов, сотрудник задаёт вопрос - система отвечает и показывает пункт, откуда взяла. Регламент поменялся? Заменили файл, всё. Дообученная модель в этом месте потребовала бы полного цикла переобучения.

4️⃣ Дообучение
Здесь мы действительно меняем саму модель. Показываем ей тысячи примеров правильного поведения, и она сдвигает свои веса.

Правило, которое экономит бюджеты
Знания - в базу. Поведение - в дообучение. Модель чего-то не знает? Дайте ей документы. Знает, но делает не так, как надо? Тогда – дообучайте!



Дообучение оправдано в четырёх случаях

🔹нужен жёсткий формат вывода, который промптом не удержать;
🔹узкий профессиональный язык. У нас так было с градостроительной документацией: обычная модель путала виды разрешённого использования, и никакие инструкции не помогали;
🔹нужна маленькая быстрая модель вместо большой дорогой. Дообученная модель на 8 миллиардов параметров делает одну узкую задачу не хуже топовой, но на объёме дешевле в десятки раз;
🔹миллионы запросов в месяц, где длинный промпт превращается в отдельную статью расходов.

Что для этого нужно

🔻Данные. От 500–1000 пар «запрос - правильный ответ». Именно ваших, с вашими формулировками и краевыми случаями.
🔻Человек, который эти пары разметит. Это главная статья затрат, а не видеокарты. Модель выучит ровно то, что вы ей покажете, включая ошибки разметчика.
🔻Набор тестов. Сотня примеров, которые в обучении не участвуют. Без них вы не отличите «стало лучше» от «кажется, стало лучше».
🔻Метод. Чаще всего это LoRA: обучаются не все веса, а небольшая надстройка поверх. Дешевле в разы, для прикладных задач качество сопоставимое.

С чего начинать

С промпта. Потом примеры. Потом база знаний. Дообучение - последняя ступень, а не первая.

Большинство типовых задач закрывается уже на третьем шаге. Но если требуемый эффект не достигнут, тогда доводим качество дообучением.

А у вас были задачи, где промпта не хватило?
  • 👍 6
  • ⚡ 3
  • 🔥 3
  • 👨‍💻 3
  • ✍ 2
  • 🤓 1
  • 👀 1
More from @cialesai
  1. Sep 21, 2026Когда ваш ИИ-помощник работает на хакера Многие до сих пор думают, что главная опасность И…
  2. Sep 8, 2026Случайный Лес | AI-автоматизация без хайпа pinned a file
  3. Sep 8, 2026Практическое пособие по внедрению ИИ в процессы организаций Выпустили практическое пособие…
  4. Sep 1, 2026Неуспешный кейс: когда эксперимент признали неудачным Про удачные внедрения пишут все. Про…
  5. Aug 24, 2026Три главных разочарования при внедрении ИИ, и как их избежать Начинается всегда одинаково…
  6. Aug 18, 2026Нейрокомментаторы: возможность для роста или моветон? Под этим постом может появиться комм…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →