Qwen3.5-9B-Uncensored-HauhauCS-Aggressive – одна из самых обсуждаемых open-source нейросетей 2026 года. Она построена на архитектуре Qwen3.5 (9B параметров) и поддерживает до 262K токенов контекста.
Главное – полное отсутствие цензуры. Модель не отказывает в генерации любого контента и подходит для задач, где стандартные ИИ блокируют запросы: сложные сценарии и запросы, агрессивный SEO-контент, обсуждение механизмов обхода алгоритмов, абсолютно любые темы.
➡️ Распространяется в формате GGUF, поэтому можно запускать даже на обычном ПК.
Доступные варианты квантования:
🤩Q4_K_M (~5.3 GB). Достаточно около 8 ГБ RAM или VRAM. Оптимальный вариант по соотношению скорости и качества.
🤩Q6_K / Q8_0 (6.9–8.9 GB). Требуют уже 12–16 ГБ памяти. Более высокое качество генерации.
🤩BF16 (~17 GB). Для стабильной работы потребуется от 24 ГБ памяти, то есть уровень видеокарт вроде RTX 3090 или RTX 4090.
Для работы с изображениями нужен отдельный файл mmproj –размер около 880 МБ.
💡 Далее – разбираемся, как установить. Кликай на цитату, чтобы развернуть.
Способ 1: LM Studio (самый простой)
Если не хотите возиться с консолью — это базовый вариант.
1. Скачайте LM Studio
2. В поиске введитеHauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive
3. Выберите нужную версию (лучше Q4_K_M)
4. Скачайте mmproj, если нужны картинки
5. Откройте чат и загрузите модель
6. Включите GPU Offload в настройках
Готово — можно работать.
Способ 2: KoboldCPP (под API и связки)
Подходит, если вы работаете с Telegram-ботами, автогенерацией контента или делаете интеграции под арбитраж.
Сначала необходимо скачать KoboldCPP с GitHub, затем загрузить модель в формате .gguf и файл mmproj, который используется для обработки изображений.
После этого запустите KoboldCPP и укажите путь к модели в поле Model, а путь к энкодеру в поле Mmproj. Далее настройте параметр GPU Layers, например установите значение 32, чтобы часть нагрузки была перенесена на видеокарту. Когда все готово, нажмите Launch.
После запуска откроется чат в браузере, а API станет доступен по адресу http://localhost:5001/v1 – его можно использовать для интеграций и автоматизации.
Способ 3: Ollama (через консоль)
Подойдет, если вы уже работаете с локальными LLM и привыкли к запуску через консоль.
Сначала необходимо установить Ollama и скачать модель в формате .gguf. После этого создайте файл с именемModelfileи укажите в нем путь к модели в формате строки FROM, например:FROM ./Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf.
Далее выполните командуollama create qwen-uncensored -f Modelfile, чтобы собрать модель, и затем запустите ее черезollama run qwen-uncensored.
После запуска модель будет доступна для локального использования через консоль и API Ollama.
Способ 4: llama.cpp (для продвинутых)
Актуален, если вы работаете напрямую с движком и хотите максимальный контроль над запуском модели.
Важно учитывать, что поддержка Qwen3.5 появилась только в свежих сборках llama.cpp в 2026 году.
Пример запуска может выглядеть так:./main -m Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \
--mmproj mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
-n -1 -c 8192 -ngl 33 -i
➡️ Рекомендуемые настройки генерации
Модель работает стабильнее при корректно заданных параметрах генерации. Для режима с размышлением оптимальны значения: Temperature около 0.6, Top_p 0.95 и Top_k 20. Также важен большой контекст, желательно от 128K токенов – это напрямую улучшает качество ответов.
Для задач, где важна скорость и объем, Temperature можно повысить до 0.7, а Top_p снизить до 0.8, оставив Top_k на уровне 20. В этом режиме генерация идет быстрее, но точность немного снижается.
Иногда модель может добавлять в конце ответа фразы вроде «это не профессиональный совет». Это не фильтрация и не ограничение контента — основной ответ при этом остается полным.
Более подробно о запуске написано по ссылке.
AffTimes | #нейросети@theafftimes #полезное@theafftimes