TGViewer
NGI | Влад Корнышев про AI и создание AI-продуктов NGI | Влад Корнышев про AI и создание AI-продуктов @ngi_ru · 4K subscribers
Post #266 728
Протестировал локальный ИИ на максималках

Пока был в полете, работал над шлифовкой финальной лекции тренинга по эффективности с ИИ. Нужно было обновить часть материалов: где-то подрасписать инструкции, где-то вытащить что-то из моих выступлений и преобразовать это в нормальный конспект.

Базовый набор для таких задач: Vibe - для транскрибации и LM Studio для работы с текстами.

Vibe, как всегда, отработал на 9/10 - мелкие ошибки, не особо влияющие на итоговый результат. А вот с LM Studio было поинтереснее 🙂

Мой базовый сценарий для локальных ЛЛМ - либо быстрые задачки для суммаризации, ответов на вопросы и всякого такого, либо извлечение информации из всяких конфиденциальных встреч через те же транскрипты. В основном на английском либо на русском, где не так важен язык. В целом, все это закрывалось через Ministral 8b Q4 либо DeepCogito 14b Q4. Но при работе с длинными текстами вылез жирный минус - кривой русский язык, что в случае с конспектами сильно бросалось в глаза.

Для справки: Q - это степень сжатия модели. Несжатые модели - это FP16 и FP32, сжатые - Q8, Q6, Q4, Q2. Из сжатых самая крутая, но самая медленная - Q8, самая быстрая, но менее точная - Q2. В целом, модели ниже, чем Q4 не имеет смысла использовать. Это баланс скорости и точности.


Мне стало интересно, что сильнее влияет на работу с русским языком, на маке было несколько моделей и вот основные выводы:

Первая гипотеза: Yandex GPT 8b Q4 решит проблему с языком.
Да, проблему он решил, но модель игнорирует вообще все инструкции и пишет по-своему, а не в заданном формате.
Вывод: Для Алисы модель, мб, и норм, а для работы - мусор.

Вторая гипотеза: включение Thinking в DeepCogito 14b Q4 улучшит русский язык.
И русский и качество чуть возросли, но остались артефакты.
Вывод: Thinking дает хороший буст даже на маленьких моделях, сокращая количество артефактов но не то, как звучит язык.

Третья гипотеза: использовать Ministral на Q8, а не Q4.
Улучшился и язык (реже стал вылезать английский) и качество (тексты лучше), но все еще неидеально.
Вывод: квантизация влияет на понимание и язык, но если языка было недостаточно в обучающих данных - пользы мало

Четвертая гипотеза: Gemma 3 все порешает.
Я попробовал 4b на Q4 и Q8 и это сработало! Восьмерка справлялась чуть лучше. Но что интересно - это самая маленькая модель из всех.
Вывод: архитектура модели и ее обучающие данные - важнее размера.

Работать над задачей закончил как раз с Геммой. Наблюдениями решил поделиться в этом посте, вдруг кому еще предстоит работать в самолете)
Telegram NGI | Влад Корнышев про AI и создание AI-продуктов Лучший инструмент для транскрибации - Vibe Редко бывает так, что какой-то продукт мне прямо понравился, но сегодня речь пойдет как раз о таком. Переодически я лазаю по GitHub и ищу интересные проекты. Так я наткнулся на Vibe. И для меня, как для продакта…
  • 👍 12
  • 🔥 1
More from @ngi_ru
  1. Sep 16, 2026Делаем вторую версию конференции ROИИ Многие из вас помнят нашу первую конференцию в февра…
  2. Sep 14, 2026Post #668
  3. Sep 11, 2026Post #667
  4. Sep 9, 2026Post #666
  5. Sep 8, 2026Post #665
  6. Sep 3, 2026Kickstarter как лучший тренажер для продуктового питча Поймал себя на том, что в последнее…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →