TGViewer
Борис опять Борис опять @boris_again · 17.6K subscribers
Post #4109 1.34K
#дайджест
Дайджест AI/ML за неделю 14–20 сентября 2026

Alibaba: Qwen3.8-Omni-Flash
Модель под агентов с упором на омнимодальность. Заявляют что лучше Gemini 3.8 Flash на его поле: WildClawBench-MM 71.0 против 58.9, диаризация митингов 3.4 против 72.6 ошибки. На видео примерно паритет. Цена $0.15/$0.47, аудио на входе подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет.
Блогпост, API

Google: Gemini 3.8 Live и Live Extended Thinking
Две speech-to-speech модели: обычная дешевая и Extended Thinking, которая думает и говорит одновременно, заполняя паузы фразами в духе "сейчас гляну". Первое место в Speech to Speech индексе Artificial Analysis с 82.6, t-Voice 68.6%, 97 языков с автоопределением. Уже в API, AI Studio, Search Live и Workspace
Блогпост, Model Card

Apple: Siri AI
Небольшой стартап из Купертино спустя два года после анонса доучил Siri делать то что обещал: искать по переписке и фото по описанию, видеть экран, ходить в интернет и делать действия в сторонних приложениях. Под капотом Apple Foundation Models, сделанные в сотрудничестве с Google и Gemini, часть на девайсе, часть в Private Cloud Compute. Бета по вейтлисту, в ЕС и Китае нет.
Блогпост

TypeSafe AI: Jev
Модель, которая не генерирует текст, а сразу выдает решение: да/нет, вариант из списка или скор, с калиброванной вероятностью (согласно разработчикам, а на деле оказалось скамом: ранжирование меняется от порядка входов). Не авторегрессионная, отвечает за 70–500 мс, $0.042 за миллион входных токенов, выход бесплатный. В демо играет в Doom по структурированному состоянию игры.
Твиттер открыл для себя классификаторы и теперь на них можно запускать дум.
Документация, The Register, Илья бенчмаркнул

Shengshu: Vidu S2
Реалтайм-ветка Vidu из двух моделей.
S2-Avatar - анимирует персонажа с картинки в 720p по голосу или тексту, референс можно менять в процессе.
S2-Editing - правит входящий видеопоток на лету: стиль, одежда, замена персонажа и фона.
Есть экспериментальный стерео-режим для VR. Демо и API открыты.
Статья, демо

ElevenLabs: Music v2.5
Богаче аранжировки, живее инструменты, особенно в вокальных и акустических жанрах.  Обучена на лицензированной музыке, поэтому в отличие от Suno в суде не сидит (и похуже звучит). Доступна всем, включая Free с пятью скачиваниями с полным качеством в день, и в API.
Блогпост

Creatify Labs: Boreal

Уже сотая новая видеомодель, целятся в рекламу и UGC. Генерирует в реалтайме, пять секунд за пять секунд, 720p по центу за секунду, 1080p по три. Дообучена с открытой базы на рекламе, в слепых тестах ее предпочли базе в 81% случаев. Какая база, не говорят.
Пресс-релиз, fal

HiDream: O1-Video-1.0
Омнимодальная видеомодель теперь с упором на физику: текст, картинки и видео на входе, 1080p от 5 до 20 секунд с синхронным звуком. Четвертое место в Image-to-Video with Audio у Artificial Analysis, восьмое в Arena. Пока internal testing, обещают скоро.
Пресс-релиз, документация

Deveillance: Kalypta
Приложение, которое делает вашу речь неслышимой для Voice-to-text моделей: локальная модель в реалтайме искажает голос так, что люди слышат как обычно, а Whisper и Canary теряют две трети слов. Работает в Meet, Zoom и Teams, бета на Mac по вейтлисту.
Kalypta, бенчмарки

Anthropic: treat report
Кому интересно как всякие китайцы в серую используют подписки Claude, читайте репорт на 150стр. там и отправка ответов клода юзерам муншот для последующей дистилляции, и использование китайской и русской гэбней.
Отчет, TechCrunch

QuiverAI: Arrow 2 и Arrow 2 Telos - генерация и редактирование SVG. Меньше лишних узлов, векторизация растра. Telos - версия с ризонером сверху, контекст 1М, $6/$30 против $4/$20 у обычной. Блогпост

Runway: Enhance Frame Rate - интерполяция до 24/30/60/120 fps в API, до 300 секунд за раз,. Цены

Mirelo: Audio-to-MIDI Pro - раскладывает готовый микс на отдельные MIDI-дорожки по инструментам, включая вокал, плюс аккорды, темп и экспорт в MusicXML. Выросла из открытой модели с Kyutai. Модель
qwen.ai Qwen offers comprehensive functionality spanning chatbot, image and video understanding, image generation, document processing, web search integration, tool utilization, and artifacts.
  • 👍 2
  • ❤ 1
  • 🔥 1
  • 🤔 1
More from @boris_again
  1. Sep 21, 2026tl;dr: Research Engineers, Berkeley, $230k-930k/year Какие новости в AI Safety? Например,…
  2. Sep 19, 2026Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy…
  3. Sep 19, 2026На волне ряда сравнений разных харнессов я пересел на pi. Он отличный, всем рекомендую. Но…
  4. Sep 18, 2026Принёс вам хорошее, чтобы не пришлось открывать твиттер
  5. Sep 15, 2026#дайджест Дайджест AI/ML за неделю 7–13 сентября 2026 OpenAI: уравнения Навье-Стокса Драма…
  6. Sep 14, 2026Вышел подробный туториал по Perseus – фреймворку от команды Т-Технологий для обучения моде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →