TGViewer
Мы пилим сук, на котором сидим Мы пилим сук, на котором сидим @wearefired · 389 subscribers
Post #379 117
Продолжаем.

В прошлый раз я обещал выложить рабочий скрипт для Qwen-Image 2.1 на Маке. Выложил. Правда, пока приводил его в человеческий вид, скрипт немного распух.

Теперь это MLX Image Kit. Он сам загружает четырехбитную модель через тот самый починенный загрузчик. Есть нормальный CLI, пакетная генерация, многострочные промты, история и повтор картинки с теми же настройками.

А готовую ускорялку для Qwen-Image 2.1 устали ждать и на скорую руку сделали свою. Почти все время генерации съедают 20 тяжелых проходов трансформера. Если на очередном шаге изменения небольшие, часть из них можно просто не считать заново.

Получилось:

377 секунд -> 227
448 секунд -> 299

В сложном тесте вместо 20 тяжелых проходов понадобилось 13. Картинки при этом остались очень близкими.

Важно: все это я делал и проверял на конкретной машине, Mac mini M4 с 24 ГБ общей памяти. На других Маках должно работать, но цифры по скорости и памяти пока относятся именно к нему.

Из наблюдений по самой модели. Промты лучше писать нормальным человеческим описанием сцены, а не километром тегов. Хорошо понимает свет, материалы, эпоху, стиль и вообще происходящее в кадре.

Но если слишком подробно задавать расположение каждого объекта и все действия, результат быстро начинает выглядеть постановочным. Лучше описать ситуацию, окружение и взаимодействие объектов, а конкретную композицию немного отпустить.

Например, для картинки с котом я описал старую оранжерею после дождя, мокрые стекла, растения, стол с оставленной посудой, теплый свет внутри и холодный сад снаружи. Кота модель посадила в кресло сама. И именно он в итоге собрал весь кадр.

С текстом справляется неожиданно прилично: короткие надписи и плакаты получаются. Несколько людей в одном кадре тоже осиливает, но руки, ноги и мелкая анатомия все еще могут приехать не туда.

Технические иллюстрации выглядят убедительно, но тут важно не обманываться: это именно иллюстрации. Картинку магнитофона в разобранном виде модель нарисует, но собирать по ней магнитофон я бы не стал.

Картинки в посте - примеры работы в разных стилях.

В репозитории лежат загрузчик, CLI, пакетный режим, ускорение, примеры, инструкция и русский README.

https://github.com/proovcme/mlx-image-kit
  • 🔥 7
  • 🤔 2
More from @wearefired
  1. Sep 27, 2026Приступы Некромантии — или как найти баг в мировом открытом ПО и сделать маленький RAG-сер…
  2. Sep 26, 2026В дополнение к истории про Qwen выложу часть своего долгого теста разных локалок под своё…
  3. Sep 26, 2026TLDR: взял готовую Qwen 3.6 35B Heretic, оптимизировал под свой Mac и вырезал почти гигаба…
  4. Sep 23, 2026И снова я начитался Х перед сном и нашел там новую истерику: Qwen Image! Локальный! Беспла…
  5. Sep 19, 2026Один MCP. Один Qwen. Четыре терминала. Двадцать тысяч токенов. И где-то в секторе должен б…
  6. Sep 19, 2026Рубрика "по вопросам читателей". 1. А где добыть недорого ИИ, который будет для меня делат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →