#дайджест
Дайджест AI/ML за неделю 14–20 сентября 2026
Alibaba: Qwen3.8-Omni-Flash
Модель под агентов с упором на омнимодальность. Заявляют что лучше Gemini 3.8 Flash на его поле: WildClawBench-MM 71.0 против 58.9, диаризация митингов 3.4 против 72.6 ошибки. На видео примерно паритет. Цена $0.15/$0.47, аудио на входе подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет.
Блогпост, API
Google: Gemini 3.8 Live и Live Extended Thinking
Две speech-to-speech модели: обычная дешевая и Extended Thinking, которая думает и говорит одновременно, заполняя паузы фразами в духе "сейчас гляну". Первое место в Speech to Speech индексе Artificial Analysis с 82.6, t-Voice 68.6%, 97 языков с автоопределением. Уже в API, AI Studio, Search Live и Workspace
Блогпост, Model Card
Apple: Siri AI
Небольшой стартап из Купертино спустя два года после анонса доучил Siri делать то что обещал: искать по переписке и фото по описанию, видеть экран, ходить в интернет и делать действия в сторонних приложениях. Под капотом Apple Foundation Models, сделанные в сотрудничестве с Google и Gemini, часть на девайсе, часть в Private Cloud Compute. Бета по вейтлисту, в ЕС и Китае нет.
Блогпост
TypeSafe AI: Jev
Модель, которая не генерирует текст, а сразу выдает решение: да/нет, вариант из списка или скор, с калиброванной вероятностью (согласно разработчикам, а на деле оказалось скамом: ранжирование меняется от порядка входов). Не авторегрессионная, отвечает за 70–500 мс, $0.042 за миллион входных токенов, выход бесплатный. В демо играет в Doom по структурированному состоянию игры.
Твиттер открыл для себя классификаторы и теперь на них можно запускать дум.
Документация, The Register, Илья бенчмаркнул
Shengshu: Vidu S2
Реалтайм-ветка Vidu из двух моделей.
S2-Avatar - анимирует персонажа с картинки в 720p по голосу или тексту, референс можно менять в процессе.
S2-Editing - правит входящий видеопоток на лету: стиль, одежда, замена персонажа и фона.
Есть экспериментальный стерео-режим для VR. Демо и API открыты.
Статья, демо
ElevenLabs: Music v2.5
Богаче аранжировки, живее инструменты, особенно в вокальных и акустических жанрах. Обучена на лицензированной музыке, поэтому в отличие от Suno в суде не сидит (и похуже звучит). Доступна всем, включая Free с пятью скачиваниями с полным качеством в день, и в API.
Блогпост
Creatify Labs: Boreal
Уже сотая новая видеомодель, целятся в рекламу и UGC. Генерирует в реалтайме, пять секунд за пять секунд, 720p по центу за секунду, 1080p по три. Дообучена с открытой базы на рекламе, в слепых тестах ее предпочли базе в 81% случаев. Какая база, не говорят.
Пресс-релиз, fal
HiDream: O1-Video-1.0
Омнимодальная видеомодель теперь с упором на физику: текст, картинки и видео на входе, 1080p от 5 до 20 секунд с синхронным звуком. Четвертое место в Image-to-Video with Audio у Artificial Analysis, восьмое в Arena. Пока internal testing, обещают скоро.
Пресс-релиз, документация
Deveillance: Kalypta
Приложение, которое делает вашу речь неслышимой для Voice-to-text моделей: локальная модель в реалтайме искажает голос так, что люди слышат как обычно, а Whisper и Canary теряют две трети слов. Работает в Meet, Zoom и Teams, бета на Mac по вейтлисту.
Kalypta, бенчмарки
Anthropic: treat report
Кому интересно как всякие китайцы в серую используют подписки Claude, читайте репорт на 150стр. там и отправка ответов клода юзерам муншот для последующей дистилляции, и использование китайской и русской гэбней.
Отчет, TechCrunch
QuiverAI: Arrow 2 и Arrow 2 Telos - генерация и редактирование SVG. Меньше лишних узлов, векторизация растра. Telos - версия с ризонером сверху, контекст 1М, $6/$30 против $4/$20 у обычной. Блогпост
Runway: Enhance Frame Rate - интерполяция до 24/30/60/120 fps в API, до 300 секунд за раз,. Цены
Mirelo: Audio-to-MIDI Pro - раскладывает готовый микс на отдельные MIDI-дорожки по инструментам, включая вокал, плюс аккорды, темп и экспорт в MusicXML. Выросла из открытой модели с Kyutai. Модель
Post #4109
1.34K