TGViewer
Channel Public Channel
Neural Shit

Neural Shit

@neuralshit

Проклятые нейронные сети

Для связи: @krasniy_doshik


РКН: https://www.gosuslugi.ru/snet/676d09a44de6c368450c10e4

https://tgpost.ru/tg/neuralshit
Subscribers
53.7K
Photos
4K
Videos
1.4K
Links
2.2K
Recent Posts 11 shown
Post #7720 6.65K

Forwarded from Метаверсище и ИИще

Алибабищенко бахнул Qwen-Image 2.1 и выложил веса.

Это единая модель для генерации и редактирования изображений. Визуальная часть содержит 7B параметров и 32 Single-Stream DiT-блока. Сносно.

Ништяки:

- native 2K - базовое разрешение 2048x2048, поддерживаются в том числе 2752x1536 и 1536x2752;
- text-to-image и image editing в одной модели;
- до 10 референсных изображений одновременно;
- локальное редактирование можно задавать каракулями, нарисованными пометками или отдельными масками;
- улучшено сохранение идентичности людей и объектов при редактировании;
- улучшены типографика, портретное освещение, текстуры и мелкие детали;
- рекомендуемый стандартный режим - 40 inference steps.

Одна из самых интересных фишек - нативный RGBA и прозрачность. Модель умеет сразу генерировать объект с alpha-каналом(!), редактировать прозрачные изображения(хм) и даже типа взять обычную RGB-фотографию и извлечь из неё нужный объект в отдельный прозрачный RGBA-слой (верим? тестируем?).

Веса уже доступны на Hugging Face. Comfy Org также выложила набор весов Qwen-Image 2.1 для ComfyUI, а сама Comfy ещё до релиза заявляла нульдэй саппорт.

Лицензия - говно. Ресерч.

На рыддите, кто-то рыдает от восторга, особенно от эдит и консистентности, а кто-то ноет про кожу и мыло. Кожаным не угодишь. Жду тестов в коментах

Шопопамяти:

Хорошая новость: 24-32 GB VRAM для неё, похоже, вообще не обязательны.

На Reddit уже пишут, что модель должна нормально жить даже на RTX 3060 при квантизации.

Сама 7B-модель в INT8 около 7 GB + text encoder Qwen3-VL в W4A8 около 6 GB.

То есть суммарно порядка 13 GB весов, причём ComfyUI умеет выгружать части в RAM, поэтому 12 GB VRAM выглядит вполне нарядным вариантом.

Для нищебродов:
8 GB VRAM - скорее всего заведётся с агрессивной квантизацией/offload, но пока нет нормальных подтверждённых тестов именно Qwen-Image 2.1.
12 GB VRAM - выглядит как реальный рабочий минимум для квантованной версии в ComfyUI.

Для помещиков:
16 GB VRAM - сейчас выглядит как очень нормальный вариант. На Reddit владельцы 5060 Ti 16 GB уже радуюццо релизу именно в этом контексте.
24 GB VRAM - должно быть уже совсем комфортно для квантованной модели и, вероятно, позволит меньше гонять данные CPU<->GPU.

Для Баяр:
32 GB - может влезут и не кванты..

Почему такая разница с прежним Qwen Image: старая модель была огромной - около 20B параметров только генеративной части, а Qwen-Image 2.1 теперь жалкие 7B.

Ссылки:

Официальная страница Qwen:
qwen.ai/blog?id=qwen-image-2.1

Веса Qwen-Image 2.1:
huggingface.co/Qwen/Qwen-Image-2.1

Версия для ComfyUI:
huggingface.co/Comfy-Org/Qwen-Image-2.1

@cgevent
Post #7717 8.6K

Forwarded from Denis Sexy IT 🤖

Наткнулся на прикольдую демку, где можно посмотреть, как выглядел бы мир, если бы скорость света была 5 км/ч максимум:
https://rivendell.dmitrybrant.com/relativity/

Смотреть лучше с компьютера
Post #7716 14.7K
Это нам всем за то, что усердно молились
Post #7714 17.9K
покрал видео отсюда и накинул русских сабов. Иногда криво — это потому что сабы делал и монтировал кодекс (если бы переводил и монтировал я — было бы ещё кривее)
Post #7713 38.6K
Мне нравится, что он 3 источника как минимум приложил
Post #7712 15.3K
Главная проблема классического поиска сейчас — это чудовищный информационный шум. Если вбить туда комплексный рабочий запрос с кучей ограничений, поисковик просто выплюнет список общих статей ни о чём.

Решил затестить это в Алисе AI.

Суть проста: вместо классической выдачи поисковика со ссылками, нейросеть сама за секунду обходит рунет, выкачивает суть из десятков релевантных источников и собирает готовый ответ в виде структурированного гайда, таблиц и карточек прямо на экране. Никаких переходов по ссылкам.

Решил проверить на наболевшем: как поднять нормальную локальную нейронку без покупки дата-центра.
Задал задачу:

подбери открытую модель (на 7B–14B параметров) для локального кодинга и анализа документов. Вводные: у меня одна домашняя карточка на 12 ГБ VRAM, 32 ГБ оперативы, система на Linux. Требование — расписать оптимальный стек (какой квант брать — Q4_K_M или Q8, через что крутить: Ollama, vLLM или llama.cpp), сравнить скорость генерации (токены в секунду) и подсветить, как не словить Out of Memory при длинном контексте.


В итоге получил готовую выжимку: сравнительную таблицу моделей под мой объём видеопамяти, готовые команды для терминала под сетап и краткий список граблей с контекстным окном. Никаких блужданий по 50 веткам на Reddit и закрытым GitHub-issues. Всё собрано в одном месте.
Older posts →

About this channel

How can I read @neuralshit without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Neural Shit: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Neural Shit have?
Neural Shit (@neuralshit) has 53.7K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Neural Shit know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →