TGViewer
Channel Public Channel
very vibe coding

very vibe coding

@veryvibecoding

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Subscribers
123
Photos
463
Videos
126
Links
995

Showing posts older than #840 · Back to latest

Older Posts 13 shown
Post #839 29

Forwarded from эйай ньюз

Kling 3.0, Omni 3.0 и Image 3.0

В теории это значит, что теперь Kling безоговорочная SOTA — он и так составлял достойную конкуренцию Veo 3.1, обладая более широким функционалом и разрешением 1080p (не только через API). O1 была не самой лучшей в плане качества, но уже мультимодальной, а теперь на вход генерации можно подавать голос и даже видео в качестве элементов. Вдобавок они выкатили еще и Kling Image 3.0. Судя по успеху motion control, новое поколение моделей должно быть крайне удачным.

Черипики у Klinga ну просто какие-то божественные, в слепом тесте я бы никогда не отличил от реальных футажей. Но это черипики, а у них они всегда были хорошие.

Генерации теперь до 15 секунд (было 10) с выбором длительности шота с шагом в 1 секунду. Появился Multi-shot как в Sora 2, прикрутили нативный звук в OMNI модель и обновили Elements 3.0. Вроде как улучшили и текст, хотя не помню, чтобы с этим были проблемы.

А вот редактирования видео я пока не увидел, его можно подавать как элемент, причём генератор будет референсить движение в кадре, в том числе мимику актера. Кстати, про русский язык в анонсе не написано, интересно, будет ли поддержка.

И всё-таки я всё ещё не фанат элементов, какие бы крутые они ни были — сгенерировать начальный кадр сейчас гораздо проще и даёт больше контроля, а видос по-прежнему генерить дорого, и я сомневаюсь, что результат будет лучше чем у бананы. В этом плане обновление Kling Image 3.0 звучит гораздо интереснее. Там, как всегда, всё стало лучше, а из новых фич добавилась генерация сторибордов, где по одному промпту генерится серия последовательных во времени кадров. NanoBanana тоже таким хвалилась, но что-то, видимо, у них не задалось, не видел, чтобы эта фича нашла применение, так ещё и гугл во всю режут лимиты и косты на компьют.

Новая версия доступна на плане Ultra, на других должно быть скоро.

Ну что, догнали Kling флагмана от гугл, как думаете? Буржуа с подпиской ультра, прошу, скидывайте тесты в комментарии!

Анонс видео
Анонс картинок
Kling 2.6

@ai_newz
Post #838 34
Обновленный Qwen для кодинга с очень серьезными возможностями, который можно запустить на маке с 64гб памяти.. (не забывайте, что кроме места на модель еще нужно место на контекст, на и операционка ест 6гб)
X (formerly Twitter) Unsloth AI (@UnslothAI) on X @Alibaba_Qwen Thank you so much for releasing an open-source LLM for fast and smart coding! 🥰 We made GGUFs so you can run Qwen3-Coder-Next locally on 46GB RAM or less: https://t.co/J6Eb8c1nKO
Post #837 36
Post #836 37
Ну что, ждем сегодня Sonnet 5? Было бы круто

Честно говоря, еще очень жду DeepSeek 4 - очень любопытно, что придумали в этот раз эти творческие китайские ребята
Post #835 37
Post #834 33

Forwarded from Data Secrets

OpenAI выпустили приложение Codex

Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.

Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.

Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).

Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.

Скачать для MacOS можно тут: openai.com/codex/
Post #833 32

Forwarded from Анализ данных (Data analysis)

🔥 Новый релиз от Stepfun - Step-3.5-Flash.

По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:

Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных

Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.

Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.

https://github.com/vllm-project/vllm/pull/33523
Post #832 35
Вот с этим не поспоришь, исходя из того, как я использую агентов, я и пишу так, чтобы программы были удобны не людям, а агентам других людей. Скоро можно будет продавать только так
Telegram Dealer.AI The Companies That Already Get It (Компании, которые уже поняли) Дядя прозорлив, вот оказывается уже есть об этом статья. Новость из hacker news. 💅📦 ТЛДР. Автор вводит термин B2CC — Business-to-(AI)-Customer-Customer — и утверждает, что в 2026 г. рынок…
  • 🔥 1
Post #824 45

Forwarded from Креативный совет

😳 Новая лучшая модель для анимации?

Выходит Vidu Q3, модель, которая гордо занимает второе место на арене txt2vid

До 16 секунд видео+аудио генерации в 1080, шикарная консистентность и рендеринг текста

Помимо q3 компания так же обновила агента, добавила Q2 Reference-to-Video Pro и создала библиотеку референсов Reference Hub 2.0

@creadvice | Наш курс по ИИ Видео
Post #823 40
Post #822 45

Forwarded from Machine learning Interview

Tencent YouTu Research открыли Youtu-VL-4B-Instruct*- компактную VLM, которая серьёзно прокачивает визуальное понимание через подход VLUAS 👁️⚡

Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.

🌟 Что здесь особенно выделяется

✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.

✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).

✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.

✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.

🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.

Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.

🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF

📄 Статья
https://modelscope.cn/papers/2601.19798
Post #821 39
Встретил сегодня прикольный подход. Запуск агентов в ночную смену - это то, что делают уже многие, и то, к чему я только подхожу.

Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.

Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Post #820 39
Очень любопытная библиотека для маков по работе с голосовыми моделями - тоже в моем списке того, что надо ставить и использовать. Все-таки говорящая нейронка - это, как минимум, прикольно
X (formerly Twitter) Prince Canuma (@Prince_Canuma) on X 🔊mlx-audio v0.3.1 is out New models 🤖 > Qwen3-ASR & ForceAligner by @Alibaba_Qwen What's new ✨ > Qwen3-TTS streaming + optimized memory usage > Fixed Qwen3-TTS 0.6B CustomVoice models producing silence > Server improvements in API for STT and TTS > Poetry…
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →