TGViewer
Channel Public Channel
AI Product | Igor Akimov

AI Product | Igor Akimov

@ai_product

Subscribers
8.21K
Photos
1.3K
Videos
236
Links
1.4K
Recent Posts 19 shown
Post #2429 1.02K
AI Product | Igor Akimov В блогосфере только и разговоров, что о Jev. Который в 193 раза быстрее и в 444 раза дешевле о_О Было легкое ощущение всеобщего помутнения, когда полились статьи про «нереальный прорыв» и «уделали Альтмана». Кейсы там такие, что я до сих пор ржу. GPT-6 Astra…
Ну вот, подходящий конкурент Jev - GLiNER-2.5

Как уже писал выше их NER в GLiNER-2 я выбрал из десятка моделей для поиска и вычищения персональных данных. Это скорее 100% конкурент JEV, более под операционную часть. Передаешь текст и набор меток прямо в вызове – получаешь ответ. Без промпта, без генерации токенов, один проход.

Если по кейсам, то можно прикинуть, что это например:
– интент клиента (возврат, отмена подписки, проблема со входом)
– роутинг тикетов и писем по отделам
– сентимент, включая «mixed», и аспекты отзыва (батарея плохая, экран отличный)
– срочность, severity инцидентов, спам, модерация
– «нужно ли звать человека» и даже «закончил ли агент задачу»
– несколько решений за один вызов: интент + приоритет + нужен ли человек + темы

Можно дать метки с описаниями, если название само по себе неоднозначное, и шкалы типа 0–10 для оценок.

Бенчмарки (свой датасет fast-decisions, 17 доменов, exact match):
– GLiNER2.5-Decide 340M – 60.2%
– GLiNER2.5-Decide 1B – 59.6%
– Jev – 57.6%
– мультиязычная версия 287M – 56.7%
- Laya 46.6%

То есть обходит без проблем расхайпленный JEV, при этом работает на CPU, лицензия Apache 2.0, можно поставить на любую табуретку у себя.

Короче, это уже можно в продакшене у себя использовать. Поставить перед LLM: первичная сортировка входящего потока, быстрое принятие решений, извлечение информации, заполнение метаданных, фильтрация. Гонять коммерческую модель еще и с задержкой до провайдера по интернету будет явно дороже и дольше.

https://huggingface.co/fastino/GLiNER2.5-Decide
huggingface.co fastino/GLiNER2.5-Decide · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 🔥 9
  • 👍 3
Post #2428 1.54K
В блогосфере только и разговоров, что о Jev. Который в 193 раза быстрее и в 444 раза дешевле о_О

Было легкое ощущение всеобщего помутнения, когда полились статьи про «нереальный прорыв» и «уделали Альтмана». Кейсы там такие, что я до сих пор ржу. GPT-6 Astra на high reasoning текстом спрашивают, есть ли в документе персональные данные и почему. Она секунд 6 почти посимвольно собирает ответ «Да, есть фамилия и имя, потому что указано, кто совершал операцию». А Jev достает правильный ответ из волшебного мешочка за 100 мс. Ээээ... Такие задачи решаются JSON-ом с ответом в начале, а не простыней текста, которую потом еще парсить. И уж точно не флагманом с размышлениями – Gemini 3.8 Flash или GPT Luna сделают то же самое на порядок дешевле и быстрее.

Так о чем речь. Это нейросетка, у которой обрезан текстовый вывод. Подаете текст и варианты ответа (до 255), на выходе – вероятности. Вход стоит копье, выход бесплатно, ответ за доли секунды. Посмотрел тесты, сделал свои прогоны на классификаторе документов и категоризации отзывов. Штука прикольная, но очень специализированная.

Что хорошо:
– нормальный реранкинг за копейки (на Хабре в тесте на справочнике ОКТРУ обошел даже флагманы)
– хорошо решает задачи с небольшим количеством классов: спам/не спам, тональность, тема, запрещенка
– почти не дрифтит от перезапусков, сильно стабильнее LLM
– уверенность хорошо отделяет очевидное от серой зоны, так что сложное можно отдать умной модели и срезать расходы раза в 3–4

Что не очень:
– на тонкой классификации типа Banking77 – 81% против 84.4% у Opus 5, и на таких задачах лучшая LLM везде была выше
– на русском местами проседает (на XNLI минус 11 п.п.), и калибровка плывет сильнее
– надо нормально промптить или расписывать каскад узких вопросов, иначе работает хуже дешманских моделей
– если есть 2000+ размеченных примеров, дообученный маленький энкодер обходит Jev со свистом: 88.8% против 77.8%

На моих тестах в сравнении с Луной и Gemini 3.8 flash вышло в 2–3 раза быстрее и в 2–3 раза дешевле, а не в 100. Качество – примерно 85% от эталона. Ну-у... такое.

Плюс это еще один вендор: хостится только в США, у больших облаков его пока нет. Попробуйте объяснить это энтерпрайз-клиентам. И вы серьезно будете отправлять персональные данные на сторону, чтобы проверить, персональные ли это данные? Даже за копейки и миллисекунды? Не проще поставить GLiNER2 на свой сервер и проверять все локально за те же доли секунды?

Короче, это не убийца LLM, а очень быстрый и дешевый zero-shot классификатор уровня средних моделей. Как первый фильтр перед LLM, для роутинга, реранка и guardrails – норм. Но пороги и калибровку надо делать на своих данных, особенно для русского: вероятностям «из коробки» верить нельзя. И я на 100% уверен, что топ-лаборатории скопируют такое через месяц-два. Ребята круто прокачали генерацию данных для обучения, но с большими деньгами и ГПУшками это повторяется быстро.

https://typesafe.ai/blog/introducing-system-one-models-and-jev
typesafe.ai Introducing System One Models & Jev - TypeSafe AI Blog TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
  • 👍 18
  • ❤ 5
  • 🔥 4
Post #2427 7.66K
Google выкатил Gemini 3.8 TTS.

Видимо все силы кинул в голос )

Моделей две:
– Gemini 3.8 Flash TTS: для творческой работы, чтобы задать характер персонажа и сыграть сцену
– Gemini 3.8 Flash-Lite TTS: для больших объёмов, когда важна цена

Что умеют:
– Голос генерируется по текстовому описанию, больше 100 языков и диалектов
– Больше 2000 готовых голосов с региональными вариантами: мексиканский испанский, квебекский французский, шотландский английский
– Клонирование голоса по 30-секундному сэмплу, с проверкой согласия и водяным знаком SynthID
– Режиссура по строкам: в сценарии пишешь ремарки обычным языком, и модель их отыгрывает
– Держат голос стабильным на часах аудио
– Нативный диалог двух спикеров
– Смех, вздохи, «ага», «угу», перебивания: всё, что раньше выдавало робота
– Скоро обещают ремикс голоса: тембр, высота, темп, акцент
По бенчмаркам:
– Hume AI Voice Design: первое место (71.4), по акцентам тоже первое (60.8)
– Hume AI Overall Quality: первое и второе места у Flash и Flash-Lite
– Voice Arena: топ по японскому, бразильскому португальскому, вьетнамскому, арабскому, мексиканскому испанскому и хинди
Доступно уже сегодня

Видос: https://youtu.be/FL6mI_Br-mc

Есть и ложка дёгтя: клонирование голоса не работает в ЕС, Великобритании, Швейцарии, Индии, Иллинойсе и Техасе.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
YouTube Create your own voices with Gemini 3.8 text-to-speech Design entirely new vocal personas from scratch for gaming, immersive audiobooks, or dual-speaker podcasts using natural language prompts - directing every performance line by line with nuanced acting cues, pacing, back channeling, and dialect shifts. Or…
  • 👍 6
  • ❤ 3
  • 🔥 1
  • 🙏 1
Post #2426 9.37K
Opus 5.5 vs GPT-6 Sol и Luna – в один день!

Сегодня прям дуэль. Anthropic выкатила Claude Opus 5.5, OpenAI – GPT-6 Sol и Luna, облегчённые версии Astra. И обе продают одно и то же: почти флагман, но дешевле.

Opus 5.5:
– $4 / $20 вместо $5 / $25, кэш $0.20 вместо $0.50
– Artificial Analysis Index – 58, первое место. У Astra и Fable 5.1 по 53, для топа отрыв в 5 пунктов – это прям много
– Terminal-Bench 4.0 – 66.4% против 57.9% у Astra и 55.8% у Fable 5.1
– GDPval-AA – 1846 Elo, у Astra – 1542
– обещают починить «клодовский» стиль: главное в начале, меньше воды. Посмотрим :)

GPT-6 Sol и Luna:
– Sol – $2 / $10 (ровно как Sonnet 5). Вдвое дешевле GPT-5.6, контекст 1.05M. Luna – $0.10 / $0.50. Вообще какое-то копье, дешевле многих китайцев теперь.
– AA Index: Sol – 48, Luna – 37. Старый GPT-5.6 Sol – 47
– DeepSWE: Sol – 68.8% за $2.74 на задачу, Luna – 66.6% за $0.22. Разница 2 пункта, а цена в 12 раз ниже
– AutomationBench: Sol – 33.2% за $0.27 на задачу. Для сравнения Opus 5.5 – 40%, Astra – 41.4% за $1.73

У Anthropic есть подвох: токен подешевел на 20%, а думать модель стала больше. На индексе AA – 119K токенов на задачу против 73K у Opus 5 и 31K у Sol. CodeRabbit на код-ревью намерил +40–60% токенов. И thinking теперь вообще не выключается.

Честно сравнить сложно – каждый показывает свои бенчмарки, OSWorld у них вообще разный. На общем стенде AA Opus 5.5 на medium против Sol на max: кодинг 52.5% vs 43.9%, документы +159 Elo у Opus, бизнес-процессы вничью. Задача – $1.34 против $1.06.

Короче, Opus 5.5 сейчас самая умная модель, и в 2.5 раза дешевле Fable – кодинг и документы теперь туда. Luna – вот это прям новость для всех, кто гоняет классификацию и извлечение на потоке: в 10 раз дешевле Haiku. А Sol – такой середнячок по цене Sonnet, гонять для массовых задач. Ну и Sonnet 5.5, говорят, через пару недель.

https://www.anthropic.com/claude-opus-5-5
https://openai.com/index/introducing-gpt-6-sol-and-luna/
  • ❤ 12
  • 🔥 6
  • 👍 4
Post #2425 2.28K
Grok 4.7: фронтир по цене Grok 4.6

SpaceXAI наконец выкатили Grok 4.7 – после трёх переносов. Цена не изменилась:
– $2 / $6 за млн токенов – как у 4.6. Для сравнения: GPT-5.6 Sol – $4 / $20, Fable 5.1 – $10 / $50
– есть fast-вариант: вдвое быстрее, вдвое дороже
– доступна сразу в Cursor, Grok Build, API и у роутеров

Бенчмарки (xHigh):
– CursorBench 4.0 – 46.3% против 40.4% у 4.6 и 41.7% у Sol. Fable 5.1 впереди с 51.8%, но output у него в 8 раз дороже
– Terminal-Bench 4.0 – 38% против 20.3% у 4.6, почти вдвое. До Fable (57.9%) при этом как до Марса
– EEBench (электротехника) – 64%, лучше всех.
– Harvey Legal Agent – 19.6%, тоже первое место. Правда, у Sol там 2.5%, так что юристам пока рано волноваться
– GDPval – 1695 Elo, чуть ниже Fable (1735)
– HealthBench – 56.7%, тут позади и Sol, и Fable

Ещё заявлен полностью новый стек безопасности: пропускает только 3.3% рискованных кибер-запросов и при этом редко отказывает в легитимных. Вот это неожиданно. Для всех фичей безопасности и хитрых проверок я как раз использовал грок. Теперь видимо будут блокировать :(

Короче, супер-дешевая и крутая модель для кодинга. Вполне возможно будет в топ-3 на всех бенчах, но дешевле в 5 раз.

https://x.ai/news/grok-4-7
  • ❤ 7
  • 🤝 4
  • 😍 1
Post #2423 2.02K
Mac Studio на M5 Ultra – машина мечты для локальной разработки

О, наконец-то результаты тестов нового Mac Studio. Федерико Витиччи из MacStories четыре дня гонял топовый Mac Studio M5 Ultra (256 ГБ) против прошлого M3 Ultra (512 ГБ) и игрового ПК с RTX 5090.

По железу:
– GPU на 80 ядер, в каждом нейроускоритель – до 4,5× пикового AI-компьюта к M3 Ultra
– пропускная способность памяти 1,2 ТБ/с против 819 ГБ/с
– версия на 512 ГБ обещана в конце октября

На практике (Qwen3.8-Flash-Next, 4 бита, oMLX):
– чтение промпта – ~2 700–2 900 ток/с против ~1 100, то есть в 2,5 раза быстрее
– генерация – 108 ток/с против 70, код – 143 против 98
– промпт на 16K: первый токен через 5,6 с вместо 13,9 с
– 256K контекста: ждать ~100 с вместо ~245 с, и дальше модель пишет 75 ток/с – быстрее, чем M3 Ultra на 4K
– три параллельные сессии с субагентами: суммарно 81 ток/с против 40

RTX 5090 все еще быстрее: 3 031 против 1 701 ток/с на чтении, около +25% на генерации. Но у нее 32 ГБ VRAM – как только модель не влезает и начинается выгрузка в системную память через PCIe, скорость падает до 1,5–4,6 ток/с. Плюс шум и жара на всю комнату, а Mac на столе не слышно.

При этом за стоимость такого железа (больше десятки Кбаксов) можно несколько лет оплачивать самую дорогую подписку Anthropic и получать модель умнее. Смысл появляется там, где агенты молотят 24/7, или где данные нельзя выносить наружу – банки, госы, документы. И тут уже появляется резон покупать коробочку. Короче, для оптимизированных под Mac вещей подойдет, но если нужна прям макс-производительность и многопользовательскость, то Nvidia все еще топ.

https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
  • 👍 18
  • ❤ 2
Post #2422 9.46K
О, ура! ChatGPT доехал в Word. В компанию к Excel и PowerPoint

Видимо как раз как основа для юристов и офисных работников. Один инсталл на Word, Excel и PowerPoint. Ставится из Microsoft Marketplace, логинишься своим аккаунтом ChatGPT, дальше панель сбоку и правки прямо в документе.

Очень нравилась эта фича у Claude. По сути имеет доступ ко всем возможностям офисных программ, а не только то что в OpenOffice доступно.

Что внутри:
– черновики, переписывание кусков, форматирование – не выходя из Word
– контекст подтягивается из подключённых приложений: Outlook, SharePoint, Google Workspace, Dropbox
– skills – сохранённые инструкции под повторяющиеся задачи: инвестмемо, ревью договора, executive summary
– доступно глобально и на всех планах, включая Free!
– для Business/Enterprise/Edu данные по умолчанию не идут в обучение

Но при этом это бета. Чаты в аддине отдельные, память из ChatGPT не переезжает. Нельзя начать в одном месте и продолжить в другом. И пишут, что сложное форматирование, таблицы и графики придётся доводить руками. Но при этом работает явно лучше, чем редактирование docx напрямую!

https://chatgpt.com/apps/word/

А скачивать тут: https://marketplace.microsoft.com/en-us/product/office/WA200010215
  • 🔥 5
Post #2421 2.41K
Не доверяем LLM-ке как классификатору

Хорошая статья про типичный сценарий LLM, который работает так себе. Делаем что-то типичное: нужно сортировать обращения, письма, отзывы. Пишем промпт «это жалоба или нет?», модель отвечает «да/нет», запускаем в работу. Вроде получается неплохо – и на этом все останавливаются. Ну максимум есть "золотой сет" из 10-50 отзывов. Но потом что-то начинает сбоить и непонятно, куда бежать.

В чем проблема:
– модель не умеет честно сказать, насколько она уверена. Попросите ее оценить уверенность в процентах – получите красивую цифру, не связанную с реальностью. А значит, нельзя настроить строгость: «лучше пропустим пару жалоб, но не будем дергать людей зря» или наоборот
– модель не знает вашей реальности. У вас жалоб 1% от потока или половина? Для правильного решения это важно, а она судит «в среднем по интернету»
– если качество не устраивает, остается один инструмент – переписывать промпт и надеяться

Идея автора: не давать модели выносить приговор. Пусть она будет свидетелем, который отвечает на простые вопросы, а решение принимает маленькая старая добрая статистическая модель, обученная на ваших примерах.

Автор проверил на задаче «найди иронию в твитах». Вместо одного вопроса «это ирония?» задал модели 19 простых: автор хвалит что-то явно плохое? тон не совпадает с ситуацией? это риторический вопрос? наигранный восторг? про политику или про быт? Плюс добавил совсем тупые признаки: длина текста, число восклицательных знаков, капс, эмодзи.

Дальше простая формула на нескольких тысячах размеченных примеров учится, каким ответам сколько веса давать. Что вышло:
– точность выросла с 0.747 до 0.779 (победитель научного соревнования 2018 года – 0.705, лучшая специально спроектированная нейросеть – 0.786)
– оценки уверенности из бесполезных стали рабочими: ошибка в вероятностях упала вдвое. У голой LLM она была на уровне подбрасывания монетки
– видно, какие признаки реально влияют на решение – его можно объяснить бизнесу и аудитору
– и все это на самой дешевой модели (gemini flash-lite), без дообучения

Цена вопроса – нужны размеченные примеры. Но автор справедливо замечает: они вам и так нужны, чтобы проверить, что система вообще работает. Вы же собирались проверять, правда?
Короче, все время скоро будет уходить чисто на данные и датасеты, остальное ИИ-ка будет сама делать. И так как это мало кто делает нормально - спецы еще будут нужны 100%

https://minimallysufficient.com/posts/llm-classification-is-feature-extraction/
Minimally Sufficient LLM Classification Is Feature Engineering LLMs make good classifiers but even better features
  • 👍 12
  • ❤ 4
Post #2420 2.01K
Devin тоже добавили себе "цели", чинит все за вас

Cognition выкатили Code Scans. Можно писать просто «ускорь сборку», «улучши SEO» или «найди мёртвый код» – Devin сам прочёсывает весь репозиторий, приносит приоритизированный список находок с доказательствами, а потом открывает PR'ы на те, что ты одобрил.

Под капотом – Agentic MapReduce, та же архитектура, что у их Security Swarm:
– Plan: агент изучает репо и формулирует правила, какой код релевантен цели
– Shard: код по этим правилам режется на куски
– Map: параллельные агенты разбирают каждый кусок
– Reduce: финальный агент склеивает, убирает дубли, расставляет приоритеты

Фишка в том, что каждый батч обязан быть обработан – то есть это не «агент че-то там сделал и отчитался, что все ок», а гарантированный проход по всему отобранному коду.

Цифры из анонса:
– Dioxus (Rust): чистая debug-сборка с 58,6 до 21,0 секунды, минус 64% на 22 крейтах. Причем все валидные вещи, которые разработчики одобрили.
– Свои сайты devin.ai и cognition.com: 44 SEO-находки, health score в Ahrefs 87 → 92, медленных страниц минус 73%
– Philips на тесте: примерно 96% PR'ов вмержено и 700+ сэкономленных инженерных часов

Запускается через /scan в вебе Devin.
Короче, скоро можно будет просто сказать "сделай хорошо" :)

https://devin.ai/blog/introducing-code-scans
Devin Introducing Code Scans | Devin Code Scans turns broad engineering goals into concrete improvements across your codebase. Tell Devin what you want to achieve, and it investigates what needs to change, evaluates the findings, and turns them into pull requests.
  • ❤ 5
Post #2419 11K
OpenAI пошла отбирать хлеб у юристов

Выкатили Astra for Law. Звучит как новая модель, но нет – это та же GPT-6 Astra, которой прикрутили юридический поиск и объяснили, как думать по-адвокатски. И внезапно оказалось, что так можно было.

Что дали:
– Свой индекс по праву США: 230+ млн страниц, 99.9% всех прецедентов
– На бенчмарке 54% правильных ответов против 38.7% у той же модели с обычным поиском. Прецедентов находит на четверть больше
– Данные не хранят, люди из OpenAI ваши чаты не читают – для юристов это вообще первый вопрос
– 26 плагинов к тому, чем юрфирмы и так пользуются: iManage, Clio, Relativity, Thomson Reuters. Плюс ChatGPT прямо в Word
– Пока только избранным фирмам, в API – «скоро»

Прикол, что OpenAI сажает своих инженеров прямо в топовые юрфирмы и пилит им инструменты под ключ. Sullivan & Cromwell получили анализатор договоров, который сам предлагает правки. Ropes & Gray – разбор data room для сделок. Cooley – подготовку к IPO.

Конечно это лучше Фейбл, в примерах OpenAI показала, как Claude сослался на решение, которое потом отменили в апелляции. Пример подобран вендором, конечно, но в больное место попали. И прикол, как теперь будут жить всякие Harvey. Строишь стартап на OpenAI, а OpenAI уже сидит у твоих клиентов в переговорке.

Короче, для США задачу решили, для других стран ещё есть возможности. Пока OpenAI не придет и туда )

https://openai.com/index/astra-for-law/
OpenAI Introducing Astra for Law OpenAI for Law brings frontier intelligence for law, custom firm workflows, connected legal data sources, and legal-grade controls for confidential client work.
  • 👍 13
  • ❤ 7
Post #2418 2.28K
Google научил агентов учиться во сне

Тоже интересный материал. Google, DeepMind и пара университетов выложили Dream-RSI – подход к рекурсивному самоулучшению агентов. Тут про сон мало что, но звучит красиво :)

Когда агент (AlphaEvolve и подобные) ищет решение, он делает тысячи попыток: ветвится, запускает варианты параллельно, бросает тупиковые линии. Стратегия исследования – где копать, когда остановиться – обычно пишется руками и дальше не меняется. Улучшать её онлайн дорого: чтобы понять, хороша ли стратегия, нужно прогнать весь поиск до конца.

Идея авторов: дерево прошлых попыток – это уже готовый симулятор. Каждый узел хранит реальный результат выполнения, поэтому альтернативную стратегию можно «прогнать» по этому дереву в другом порядке – без единого нового запуска. Это и есть "сон". Мы просто проверяем по прошлым попыткам, не запускаем заново.

Как работает цикл:
– агент ищет онлайн и записывает дерево попыток
– другой агент переписывает код стратегии исследования и проверяет тысячи вариантов по накопленной истории – бесплатно
– в прод уходит только победитель, и он добавляет новое дерево в пул
– текущая стратегия тоже участвует в отборе, так что хуже она стать не может

Короче, по цифрам в 2-3 раза меньше вызовов для решения задач. Причем не надо закладывать успешные попытки в промпт, надо просто прогонять по прошлым вариантам. Короче логируйте не саммари и находки, а все попытки с результатами, это бесплатный полигон для следующих версий.

https://dream-rsi.com/
  • 🔥 6
  • ❤ 3
  • ⚡ 1
  • 👏 1
  • 💯 1
  • 🏆 1
Post #2417 2.53K
Хах, лучшая модель для хакинга – DeepSeek V4.1 Flash

Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных

Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...

https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
Enclave Enclave: DeepSeek V4.1 Flash is Now Our Best Hacking Model DeepSeek’s 11/11 result showed why advanced agent benchmarks need to check both the outcome and the attack path: our audit confirmed six planned exploits and found five unexpected routes.
  • 👍 9
  • ❤ 2
Post #2416 2.46K
Автономный ИИ для бизнеса

И еще из интересного. Те самые ребята, что ставили вендинговый автомат под управлением Claude в офисе Anthropic (Project Vend), теперь отдают свою платформу всем желающим. Pion – это то, на чём у них крутятся все реальные бизнесы: автомат, магазин Andon Market в Сан-Франциско, кафе Andon Cafe в Стокгольме и даже пара AI-радиостанций.

Что интересного в истории:
– Vending-Bench изначально делали как оценку опасных способностей. Вопрос стоял так: может ли ИИ сам добывать ресурсы, чтобы потом делать с ними что захочет. Вендинг взяли просто как самый тупой бизнес из возможных.
– В 2024 все модели застревали в циклах, а Sonnet 3.5 писал в ФБР про «киберфинансовое преступление» и объявлял бизнес квантово несуществующим.
– Opus 4 в мае 2025 первым обошёл человека. Дальше график растёт линейно – примерно +$822 к результату каждый месяц, без плато.
– В мультиагентной версии (модели конкурируют) с Opus 4.6 пошли сговор, обман и power-seeking. Anthropic после этого поменяла рецепт обучения для 4.8. Часть поведения в свежих моделях всё ещё есть.
– Реальный автомат сначала терял деньги (раздавал товар бесплатно, галлюцинировал, что у него есть тело), к концу 2025 вышел в плюс. Магазин и кафе пока убыточные – аренда и зарплаты живым людям, которых агент нанял.

Зачем открывают: им не хватает своих бизнесов и экспертизы, чтобы понять, где модели реально могут зарабатывать. Особенно интересны действующие компании с выручкой – там сигнал быстрее. Агенту дают почту, телефон, банк, браузер и защищённую среду. Пока research preview по вейтлисту.

Ну и чего, отдадите свой бизнес на полгода ИИ для науки? :)

https://andonlabs.com/blog/why-we-built-pion
Andonlabs Why we built Pion | Andon Labs Pion is the platform we built to run our autonomous businesses. Today we are opening it up so many more people can experiment with autonomous businesses, and here is why.
  • ❤ 4
  • 🔥 1
Post #2415 2.38K
Свежие бенчмарки моделей на кодинге (для очередных дискуссий, Claude vs Codex)

Specific Labs выпустили бенчмарк, где модели чинят не задачки с GitHub, а настоящий код реальных компаний – лицензировали приватные репозитории (клон Partiful на 200K+ юзеров, финтех со 100K+ банковскими выписками, enterprise sales-платформы) и взяли оттуда живые задачи: налоги в инвойсах, миграции биллинга, метеринг токенов. Код в интернете не лежит, модели на нём не учились. Результат отрезвляет.

– Лидер – Fable 5.1 в Claude Code, 38.8% решённых задач
– GPT-6 Astra в Codex – 33.8%, Grok -32.5% (вау), Gemini 3.8 Flash – 31.2%
– GLM 5.3 – 28.8%, Muse Spark 1.3 – по 23.8%, Kimi K3 – 18.8%
– GPT-5.6 Sol – 16.2%
– 6 из 10 задач решаются реже чем в 15% случаев, одну (analytics stream reducer) не решил никто ни разу
– Медианное решение трогает 11 файлов – против 6 в FrontierCode и DeepSWE
– Цена одного прогона: Gemini Flash $2.50, GPT-6 Astra $4.67, Fable 5.1 $6.96

Интересно, как модели проваливаются. Главная причина – пропущенные требования из ТЗ (у Grok – 67% всех фейлов). Вторая – «не проверил, придумал» – так падает 43% неудачных прогонов GPT-5.6. Третья – правильная идея, криво встроенная в систему (Gemini – 49%). Причём короткие прогоны до 10 минут фейлятся с той же частотой, что и длинные – проблема не во времени, а в том, что агент не понял, как устроена компания и её код.

Короче, разработчика могут заменить пока только в трети случаях. Но тут надо сказать, что описание компании и кодовых принципов в claude.md/agents.md никто не писал, это такой чисто "вайбкодинг-стайл" тест. Должно быть сильно лучше при правильном подходе.

https://withspecific.com/benchmarks/real-swe
  • 👍 6
  • 🔥 5
  • ❤ 2
Post #2414 10.4K
А вот еще штука от OpenAI для инвестбанкиров (удивительно, как OpenAI сжирает все больше вокруг себя)

Целевая аудитория – люди в инвестбанках, которые целыми днями готовят отчёты по компаниям: сколько стоит, сколько зарабатывает, стоит ли покупать, кому можно продать.
Что изменилось по сравнению с обычным ChatGPT:
– внутри уже есть платные базы данных, за которые аналитики обычно платят отдельно: финансовая отчётность компаний, расшифровки звонков с инвесторами, новости, данные о стартапах и частных компаниях. Не нужно копировать таблицы руками – модель сама достаёт цифры
– если у банка уже куплены подписки на другие источники данных, они подключаются одним логином
– каждая цифра в ответе со ссылкой на источник – можно проверить, откуда она взялась, а не гадать, придумала ли модель
– админ загружает фирменные шаблоны Excel, Word и PowerPoint – и ChatGPT собирает презентации и финансовые модели сразу в корпоративном оформлении
– всё, что требует служба безопасности банка: разделение доступов между отделами, чтобы аналитик не увидел инсайд из соседней сделки, единый вход, логи для проверяющих, данные не идут в обучение
Партнёры на старте – Morgan Stanley и Evercore. Цен нет, «свяжитесь с отделом продаж».

Короче, модель + профильные данные + шаблоны документов + корпоративная безопасность = продукт под индустрию. Следующие очевидные кандидаты – юристы, медицина, страхование. И это удар по стартапам, которые последние два года делали «ChatGPT для аналитиков» поверх API OpenAI – платформа пришла и сделала то же самое сама...

https://openai.com/index/introducing-chatgpt-financial-services/
OpenAI Introducing ChatGPT for Financial Services Introducing ChatGPT for Financial Services, combining built-in financial data and GPT-6 Astra for research, modeling, and client-ready materials.
  • 👍 12
  • 🔥 2
  • ❤ 1
Post #2413 2.71K
Опа, OpenAI выпустила Agents API – ИИ-агент из коробки

Одним вызовом описываете задачу, модель, инструменты и окружение – и получаете готового агента, который работает на той же оркестрации, что Codex и агенты внутри ChatGPT. То, что раньше надо было руками собирать на всяких библиотечках. И по сути конкурент anthropic managed agents.

Что внутри:
– автоматическая компрессия контекста, когда сессия подходит к лимиту
– tool search – определения инструментов подгружаются по мере надобности, а не висят в промпте и жгут токены
– programmatic tool calling – параллельные вызовы и цепочки
– субагенты из коробки (по умолчанию до 3 параллельно)
– MCP, свои функции, встроенный веб-поиск
– два варианта исполнения: песочницы OpenAI или свой compute, с интеграциями Cloudflare, Vercel, Modal, E2B, DigitalOcean, Oracle и др.

Цены: отдельной платы за сервис нет, платите только за токены и инструменты. Харнесс открытый – это тот самый Codex, код лежит на GitHub.

Цифры от ранних клиентов: SafetyKit – минус 60% стоимости на кейс, Hypha – минус 86% неудачных ответов агента, Ciridae – качество на евале с 0.71 до 0.85 и латентность в 4 раза ниже.

Короче, теперь бьют по прослойке фреймворков. Стартапы и компании собирали на LangGraph и Agents SDK то, что здесь дают одним вызовом – память, компрессию контекста, subagents. Теперь вопрос к вам будет «а зачем нам это все». Но с другой стороне все держите у OpenAI, переезжать больнее. Короче, для простых клиентов и собственных проектов - норм, гораздо проще, чем раньше. Для продакшена и энтерпрайза - ну такое.

https://openai.com/index/introducing-the-agents-api/
OpenAI Introducing the Agents API Build and launch cloud agents with the Agents API, a managed service powered by the Codex harness for orchestration, long-running sessions, and tool use.
  • 👍 13
  • ❤ 1
Post #2412 2.73K
О, и GPT-Live-1 теперь в API!

Голосовую модель из ChatGPT открыли разработчикам. Главное – full-duplex: модель слушает и говорит одновременно, без каскада STT – LLM – TTS и ручной обработки перебиваний.

– Думать отдаёт бэкенду: GPT-6 Astra, Luna или сторонней модели
– Full Duplex Bench – плюс 30 пунктов к прошлой GPT-Realtime-2.1
– Speak: перебиваний на паузах меньше почти на 80%
– Телефония из коробки, 12 новых голосов

$0,05 за минуту голосового слоя – $3 в час плюс токены бэкенда. Ну с этим уже можно жить!

https://openai.com/index/introducing-gpt-live-1-in-the-api/
OpenAI Build more natural voice experiences with GPT‑Live‑1 in the API GPT‑Live‑1 brings natural, full-duplex voice conversations to the API, with stronger instruction following, custom voices, and telephony support.
  • 🔥 22
  • ❤ 1
  • 🙏 1
Post #2411 3.58K
OpenAI побили еще сотню стартапов "AI аналитики"

Выпустила Data agent в ChatGPT Work – плагин, который подключается к корпоративным данным, сам пишет SQL, ищет, что изменилось, и собирает интерактивные дашборды, которыми можно поделиться. Вопрос задаёшь словами, код не нужен.

Что внутри:
– источники: Snowflake, BigQuery, Databricks, Redshift, ClickHouse, MongoDB, Datadog, плюс Google Drive и SharePoint
– BI: Tableau, Power BI, Sigma, ThoughtSpot, Omni, Oracle BI
– семантический слой: агент берёт термины, метрики и формулы из dbt, Databricks Genie, Snowflake Horizon, GitHub и самих дашбордов – чтобы «выручка» считалась так, как у вас принято, а не как модели показалось
– права: запросы идут под учёткой пользователя со всеми ограничениями по таблицам, строкам и колонкам
– после анализа – рекомендации, кому из коллег это показать, и выгрузка в Slack или почту

Внутри OpenAI это уже стандарт: почти вся продуктовая команда и две трети GTM сидят в этом агенте. Года 2 назад, еще до размышляющих моделей, как раз строили подобную штуку... Теперь это из коробки доступно. Text-to-SQL без него все пробовали, и все получали красивые уверенные цифры, которым нельзя верить. Много приходилось писать прям функций руками, которые может вызывать ИИ, чтобы результат был одинаковый. Теперь думаю с такой клиентской базой и такими провайдерами это вопрос решенный

https://openai.com/index/put-data-to-work/
  • ❤ 24
  • 👍 4
  • 🔥 2
Post #2410 8.7K
Посмотрел, что там Apple представила нового в девайсах по ИИ (спойлер - переупакованный Gemini)

Короче, что нового:
– Siri AI выходит в бете 14 сентября с iOS 27. ТОЛЬКО НА АНГЛИЙСКОМ. Остальное подтянется в октябре и дальше. Отдельное приложение с историей диалогов в iCloud, понимание личного контекста (почта, сообщения, фото), осведомлённость об экране и действия внутри сторонних приложений через App Intents (если разработчики поддержали).

– Под капотом – пять моделей третьего поколения, сделанных «в сотрудничестве с Google»: AFM 3 Core на 3B на устройстве, AFM 3 Core Advanced на 20B со sparse-архитектурой (активны 1–4B за раз), облачные AFM 3 Cloud и ADM 3 Cloud для картинок, и AFM 3 Cloud Pro – который крутится на NVIDIA в Google Cloud. Apple арендует чужие GPU под чужой моделью, немыслимо...

– Айфончеги на A20 Pro: 2 нм, два 16-ядерных Neural Engine (32 ядра суммарно), вдвое больше вычислений под on-device ИИ, +50% пропускной способности памяти. iPhone 18 Pro – $1199, Pro Max – $1299, в продаже 18 сентября.
– Складной iPhone Duo за $1999: 5,4" снаружи, 7,6" внутри, тот же A20 Pro. Предзаказ 16 октября. Красивый блокнотик, Samsung там уже в Твиттер изошелся, что через 8 лет Apple догнал )
– AirPods 5 за $129 – чип H3, Live Translation на десятке языков (русского нет, типичные европейские и азиатские) и разговор с Siri на ходу.
– Watch Series 12 ($399) и Ultra 4 ($799): Health Age, Readiness score 0–10, всякая прочая геймификация жизни, пульс каждые 5 секунд, Audio Intelligence с Live Rewind – отматывает последние 15 секунд звука, если вы прослушали (это прикольно, но странно)

– Из интересного еще Apple Reference Image – подтверждение, что фото снято на iPhone, а не сгенерировано.

Короче, Apple арендует и покупает ИИ у остальных, как-то грустновато... Ну и делает гибрид под мини-модель, норм-модель и облако. Ну и если у вас приложение, то поддержка App Intents – маст-хев. Иначе сири про вас ничегошеньки знать не будет.

apple.com/newsroom
Apple Newsroom Newsroom The official source for news about Apple, from Apple. Read press releases, get updates, watch video and download images.
  • ❤ 3
  • 👍 2
  • 😐 1
Older posts →

About this channel

How can I read @ai_product without a Telegram account?
TGViewer shows the public web preview Telegram publishes for AI Product | Igor Akimov: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does AI Product | Igor Akimov have?
AI Product | Igor Akimov (@ai_product) has 8.21K subscribers on Telegram, refreshed roughly every 30 minutes.
Does AI Product | Igor Akimov know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →