Пока был в полете, работал над шлифовкой финальной лекции тренинга по эффективности с ИИ. Нужно было обновить часть материалов: где-то подрасписать инструкции, где-то вытащить что-то из моих выступлений и преобразовать это в нормальный конспект.
Базовый набор для таких задач: Vibe - для транскрибации и LM Studio для работы с текстами.
Vibe, как всегда, отработал на 9/10 - мелкие ошибки, не особо влияющие на итоговый результат. А вот с LM Studio было поинтереснее 🙂
Мой базовый сценарий для локальных ЛЛМ - либо быстрые задачки для суммаризации, ответов на вопросы и всякого такого, либо извлечение информации из всяких конфиденциальных встреч через те же транскрипты. В основном на английском либо на русском, где не так важен язык. В целом, все это закрывалось через Ministral 8b Q4 либо DeepCogito 14b Q4. Но при работе с длинными текстами вылез жирный минус - кривой русский язык, что в случае с конспектами сильно бросалось в глаза.
Для справки: Q - это степень сжатия модели. Несжатые модели - это FP16 и FP32, сжатые - Q8, Q6, Q4, Q2. Из сжатых самая крутая, но самая медленная - Q8, самая быстрая, но менее точная - Q2. В целом, модели ниже, чем Q4 не имеет смысла использовать. Это баланс скорости и точности.
Мне стало интересно, что сильнее влияет на работу с русским языком, на маке было несколько моделей и вот основные выводы:
Первая гипотеза: Yandex GPT 8b Q4 решит проблему с языком.
Да, проблему он решил, но модель игнорирует вообще все инструкции и пишет по-своему, а не в заданном формате.
Вывод: Для Алисы модель, мб, и норм, а для работы - мусор.
Вторая гипотеза: включение Thinking в DeepCogito 14b Q4 улучшит русский язык.
И русский и качество чуть возросли, но остались артефакты.
Вывод: Thinking дает хороший буст даже на маленьких моделях, сокращая количество артефактов но не то, как звучит язык.
Третья гипотеза: использовать Ministral на Q8, а не Q4.
Улучшился и язык (реже стал вылезать английский) и качество (тексты лучше), но все еще неидеально.
Вывод: квантизация влияет на понимание и язык, но если языка было недостаточно в обучающих данных - пользы мало
Четвертая гипотеза: Gemma 3 все порешает.
Я попробовал 4b на Q4 и Q8 и это сработало! Восьмерка справлялась чуть лучше. Но что интересно - это самая маленькая модель из всех.
Вывод: архитектура модели и ее обучающие данные - важнее размера.
Работать над задачей закончил как раз с Геммой. Наблюдениями решил поделиться в этом посте, вдруг кому еще предстоит работать в самолете)