TGViewer
Python Portal Python Portal @pythonportal · 50.3K subscribers
Post #6121 3.89K
image_2026-09-14_08-40-46.png1.1 MB
Большинство слышит «дообучение» и сразу думает, что мы обновляем миллиарды весов большой языковой модели.

Но часто это не так.

Современные методы дообучения позволяют адаптировать модель, почти не трогая её исходные предобученные веса.

Если вы переходите из Data Science в AI Engineering, стоит знать эти 5 подходов.

1. LoRA — учим обновление, а не сами веса

Замораживаем W.

Обучаем две небольшие матрицы:

ΔW = BA

То есть:

W' = W + BA

Фактически мы учим небольшую поправку к модели.

2. LoRA-FA — замораживаем ещё больше

Замораживаем W и A.

Обучаем только B.

Идея та же, но обучаемых параметров ещё меньше.

3. VeRA — не обучаем даже сами матрицы

Фиксируем случайные A и B.

Обучаем только небольшие векторы масштабирования, которые управляют вкладом этих матриц.

Очень высокая параметрическая эффективность.

4. Delta-LoRA — позволяем базовой модели тоже меняться

В отличие от обычной LoRA, здесь W тоже может обновляться, но эти изменения направляются низкоранговой адаптацией.

5. LoRA+ — та же LoRA, но с другой оптимизацией

A и B обучаются с разными скоростями обучения.

Обычно:

ηB > ηA

Главная идея здесь в том, что дообучение не обязательно означает переобучение всей модели.

LoRA → 2 матрицы
LoRA-FA → 1 матрица
VeRA → векторы масштабирования
LoRA+ → 2 матрицы с разными скоростями обучения
Delta-LoRA → низкоранговые обновления + изменяющиеся базовые веса

Пять подходов к одному и тому же вопросу:

какой минимум нам на самом деле нужно обучать?

Именно это и есть параметрически эффективное дообучение — концепция, которую стоит понимать специалистам по Data Science при переходе в AI Engineering.

👉 @PythonPortal
  • ❤ 8
  • 👍 5
  • 🔥 3
More from @pythonportal
  1. Oct 4, 2026«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить мате…
  2. Oct 3, 2026«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024…
  3. Oct 3, 2026Tencent выпустила новую модель для перевода, которая, по их словам, обходит Google Transla…
  4. Oct 2, 2026Один из лучших ресурсов по производительности SQL: use-the-index-luke.com 👉 @PythonPortal
  5. Oct 2, 2026Многие постоянно путаются в этом: В чём на самом деле разница между 100 МБ/с и 100 Мбит/с?…
  6. Oct 1, 2026Исследователи MIT математически доказали, что ChatGPT устроен так, что может затягивать по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →