🔹 ChatGPT Images 2.5 — генератор картинок OpenAI наконец держится за исходник при правках
Вышла 8 сентября, раскатывается на все тарифы ChatGPT, Codex и API. До 50% быстрее второй версии. В API две модели: Flare — быстрая, Sunburst — медленнее, но точнее в сложном редактировании.
— правит один элемент, не разваливая остальное: лицо, персонаж и композиция после цепочки правок держатся, фон не дёргается
— режим Sketch: рисуете каракули прямо в чате, добавляете описание — модель берёт рисунок как инструкцию
— комментарии прямо на картинке для точечных правок, шаблоны Poster и Merch
— в API произвольное разрешение до 4K и шесть уровней качества; максимум в 1024 — около $0,21 за картинку
Презентация в комментариях.
🔹 Suno v6 — три модели сразу и правка отдельных слов в готовом треке
Вышли 9 сентября: v6 и v6-wild для Pro/Premier ($10 и $30 в месяц), v6-mini — всем, включая бесплатный тариф. Старые модели отключают. Обучена на лицензированных каталогах Warner, BMG и Believe.
— меняет фрагмент песни текстовой командой, не пересобирая трек: одну строку или даже слово
— вырезает кусок аудио, например гитарный рифф, и строит вокруг него новый бит; собирает мэшап из своих треков
— на вход принимает текст, аудио, картинку и видео вместе — можно дать ролик и получить музыку под него
— v6-wild — та же модель с выкрученной непредсказуемостью: ловите странную идею там, дорабатываете в обычной v6
🔹 FLUX Video Edit — загружаете своё видео, пишете текстом что поменять, получаете тот же ролик с правкой
Black Forest Labs выпустили 10 сентября. Суть: берёте уже снятый или сгенерированный клип, пишете «замени суши на мясо» или «сделай ночь вместо дня» — и получаете тот же самый ролик, где изменилось только это, а движение камеры, актёры и всё остальное остались как были. Раньше ради одной детали приходилось перегенерировать сцену целиком. Доступно на сайте BFL и на fal, $0,03 за секунду ролика: 10-секундный клип — 30 центов, независимо от сложности правки.
— что можно менять: убрать или добавить предмет, заменить персонажа, поменять фон, материал, освещение, надпись в кадре
— можно переозвучить героя: пишете новую реплику, модель меняет речь и подгоняет губы — но фраза должна быть той же длины, что оригинал
— чего нельзя: ролик дольше 15 секунд не возьмёт, на выходе всегда 720p, показать картинкой «вот такой объект хочу» нельзя — только описать словами
Презентация в комментариях.
🔹 DeepSeek V4.1 Flash — открытая модель, которая в агентных задачах догнала Opus 5
Вышла 10 сентября, веса под MIT — можно крутить у себя или у любого хостера, не завися от API DeepSeek. Одна модель вместо трёх: быстрые ответы, глубокое рассуждение и понимание картинок, режим выбирать не нужно. Контекст 1 млн токенов.
— в задачах «сделай сам в терминале» — 74% против 74% у Opus 5 и 73% у GPT-5.6 Sol, а в автоматизации рутинных цепочек действий — первое место среди всех
— видит картинки: можно кинуть рендер или референс и обсуждать его, а не описывать словами
— глубина рассуждения регулируется по шкале от 1 до 100 — на простое отвечает мгновенно, на сложное думает долго, и это ваш выбор, а не модели
— память под длинный контекст ужали в четыре раза — большие проекты и длинные диалоги не тормозят и не забываются
— при этом стоит как самая дешёвая младшая модель: $0,15 за миллион на входе
График в комметариях.
🔹 Unity Agent Plugin — официальный плагин Unity для Claude Code и Codex
Вышел 9 сентября, ставится одной командой. 29 готовых скиллов от инженеров Unity для Unity 6+ плюс Unity CLI и MCP-сервер для управления редактором.
— задача обычным текстом: экран настроек, внутриигровые покупки, мультиплеер с голосовым чатом, шейдеры и URP
— агент сам определяет область задачи и подгружает нужные инструкции
Презентация в комментариях.
@VAI_ART
#VAI_News
