Ой, вы представляете, чисто случайно нашел хакнутую 31B версию, еще и открыв для себя Heretic.
И что-то дернуло меня ради теста взять RTX 6000 под мои генерации, а в очевидно свободное место, которое только видео генерация выжрет — поставить локальную llm.
Я говорил, что главное для нас это, так называемый на пендостанском tools, не работает на малых моделях внятно. А не малые модели требуют видео карты в цену моей почки после 4 банок адреналина.
Как бы уже есть скидос за не товарный вид, но это все еще очень дорогая и важная вещь. А именно там можно получить тот самый опыт, посмотреть на что же способны локальные модели.
Короче, ноги растут от этого поста и я просто хотел посмотреть потолок возможностей локальных нейросетей на самом мощном железе, что вообще можно взять с рынка.
Ну вот все тесты я проводил на 6000. Видяха стоит 1.5кк рублей, аренда ее обходится чуть больше одного доллара в час.
А почему версия без цензуры?
Ой, я так рад, что ты спросил.
Так вышло, что у меня есть на руках куча разных хак промптов, где я понимаю смысл и суть, и они даже в 90% случаев рабочие. Там даже можно писать мальварь через opus 4.7-4.8, но я эту хуйню осуждаю.
Меня больше техническая сторона волнует. Могу ли я одним агентом писать хаки для другого агента? Потому что сами нейронки готовы подставить под хвост в задачах: "кс 2 го хакнем".
Но абсолютно непоколебимы в вопросе написания промптов. Если у них не срезаны веса цензуры, понимаешь?
Поэтому, если в моем фидбеке модель будет тупить и глючить это последствие вырезания цензуры из нее или квантования, ту же Gemma4 я пробовал на Q4 и что-то могло сломаться.
И вот так я прихуярил это в Hermes
Первые впечатления были просто песня. Я скипнул запуск телеграм бота, продолжил в терминале на сервере.
Общалась очень живо и бодро. Начали прописывать личность, спросить про ллм вики — все знает, все сделает. Начали делать, расписали скиллы для анализа и сборки хак промптов.
Провели глубочайший реверс-инженеринг, выписали все ключевые моменты. Казалось я близок к тому, чтобы сделать свой идеальный хак-промпт, но тут мне судьба дала по яйцам.
Нужно было быстро передать и забрать много .txt, ибо хак промпты по объему от 300 строк, меньше нейросети палят, не хватает простора текста для манипуляций. И тут понеслось.
1. Gemma 4 31B полтора часа не могла поднять гетвей телеграм Hermes по документации. Если что, DeepSeek V4 flash это делает всегда с первой попытки за 2 минуты.
2. Как бы ты не просил, не прописывал скилл. Гемма просто не могла написать промпт на 300 строк, каждый раз по кругу врала.
3. Скинь мне файл в телеграм = "да, вот отправил напрямую". Каждый раз отправляла файл неправильно. Слава богу хоть иногда получалось.
Подобная проблема с объемом промптов была и у Qwen 3.6 Heretic от того же автора. Равно как и постоянная отправка пути медиа вместо самого файла, что по 3-4 раза пинать приходилось.
Правда я свой план в итоге Qwen 3.6 и реализовал, мне даже понравилось. Я имею ввиду, что на бОльших весах это прям хорошая модель.
Но здесь важно уточнить
Я точно знаю, что на ней делают в том числе OFM, ибо она изумительно работает с текстом. А в наше время дрочить приходится на буковки в первую очередь, что я одобряю.
Как раз таки текстовую работу, работу со скиллами и памятью Gemma 4 31B выполняла отлично. Это правда похоже на уровень платных закрытых моделей. Для сравнения, существует ее версия натянутая под вайбкод Fable5.
И вот эта натянутая версия 12B с самым мизерным квантованием жрет примерно как наша большая геммочка, только буквально выдумывает использование инструментов Hermes.
Поэтому, на арендованном железе я смог ощутить опыт близкий к привычному любому, кто НЕ нищий. Тем более, что нейросети без тормозов сами по себе крайне интересны.
Но никакой заменой тут не пахнет. Слишком дорого, слишком ограниченно, слишком криво, слишком нестабильно. И хочется верить, что это пока что.
Но об этом чуть позже.
