TGViewer
Channel Public Channel
Айра Монгуш — AI, tech & math

Айра Монгуш — AI, tech & math

@airamongush

Канал о бизнес-моделях в AI, прикладных обзорах технологий и релеватных апдейтах моей жизни
https://airamongush.com
Subscribers
984
Photos
91
Videos
7
Links
78
Recent Posts 20 shown
Post #199 209

Forwarded from Пепел Грамши

Атмосфера на кампусах сегодня: phd студенты бегают по коридорам и кричат, что гипотеза Ходжа только что взлетела на 20% на polymarket… А про Бёрча-Свиннертон-Дайера шепчутся — мол, найден контрпример. Кстати, Гротендик в гипотезу Ходжа верил. Но это скорее было в духе, что если не верна, то тем хуже для неё.
  • 🤓 6
Post #198 306
  • ❤ 5
Post #197 423
Тувинская и якутская клавиатуры добавлены в iOS 27

Для новичков в канале — я основательница стартапа Algebras AI, которая автоматизирует локализацию для игр, UGC-контента, b2c-приложений и тд. А проект был вдохновлен работой по сохранению низкоресурсных языков, включая тувинский язык (мой родной).

Сохранение языков помогает народам продолжать общаться и создавать больше контента уже в цифровом виде, что усиливает его позицию в мире. Многие языки уже мертвы (не осталось ни единого его носителя), и еще больше сейчас под угрозой исчезновения.

А зачем это нужно для цивилизованного мира? У многих народностей есть тысячелетние повествования, сказки, песни и фольклор, которые сохраняют знания о тех временах, и из этих знаний и самой структуры современного языка можно узнать многое о родстве тех или иных культур. То есть фактически сохранение языков помогает восстанавливать историю человечества и дает более глубокие антропологические данные. А зачем нам история и антропология — мы уже понимаем лучше.

Что вообще в себя включает сохранение языка через цифровые системы и ИИ?

1. Анализ состояния языка: какие бумажные или плохо оцифрованные ресурсы уже есть (книги, аналоговые сканы, диджитализированные сканы), определение, в каких системах язык не доступен (иногда у языка может даже отсутствовать алфавит в международных системах кодирования). Если их нет, то нужен сбор устных данных.

2. Создание/включение алфавита и главное — клавиатуры в Unicode (опенсорсный международный стандарт для данных (шрифты, инструменты, библиотеки) и программного обеспечения) и другие стандарты: практически все операционные системы, включая iOS, Android, Windows, MacOS, Linux, Chrome, браузеры и другие программы поддерживают эти стандарты и регулярно адаптируются к их обновлениям. Без клавиатур НЕВОЗМОЖНО вообще собрать никакие значные данные. И это сильный боттлнек для сохранения языка.

3. Сбор данных: моноязычные данные - книги, статьи, аудио/видеозаписи и тд. И мультиязычные параллельные данные (словари и просто переводы). Для низкоресурсных языков достаточно около 30-50 тыс параллельных переводов хорошего качества для первых результатов (обучения переводческой модели), и если у языка есть высокоресурсные соседи (например, для тувинского это тюркские языки, включая турецкий, азербайджанский, казахский, узбекский, кыргызский и т.д.) — то уже от 100 тыс до 1 млн слов параллельных данных могут.

Али, мой со-основатель проекта русско-тувинского ИИ-переводчика, организовывал более десяти лет сбор данных и переводы волонтерами и институтами в Республике Тыва, что стало основой для обучения первой модели. Мы также помогали советом или примером, а иногда и для сбора данных и для других языков постсоветсткого пространства.

4. Обучение моделей: вы можете обучить как шаг 1 переводческую модель на базе открытых весов (NLLB - мы обучили эту модель как первый вариант, TranslateGemma), и уже в будущем нагенерировать больше instruct-данных для обучения своей LLM новому языку. Благодаря данным, собранным под его руководством, тувинский язык был включен сначала в Google Translate и Gemini, и потом в Яндекс Переводчик.

Среди государств в 2026 практически все имеют свой язык и клавиатуру на популярных OS и браузерах. А народы, чьи языки не в первом приоритете, уже не имеют таких привилегий, и приходится своими усилиями добиваться репрезентации языков в системах.

Али смог довести до релиза клавиатуры для тувинского и саха в iOS 27 (и я думаю в MacOS тоже) — что является огромным достижением и возможностью для тувинцев и якутов собирать больше данных для обучения своих моделей. С чем я его поздравляю, и поздравляю наши народы 🙂
Telegram Ali Kuzhuget (AI, NLP, keyboards, Dev) Блог математика-разработчика. Сейчас развиваю кириллические клавиатуры на iOS! @agilight
  • ❤ 10
  • 👍 4
Post #196 274
6. AGI и RSI это разные вещи, и приравнивать их значит путать цель со средством. RSI это механизм, потенциально мощный, но пока не замкнутый; AGI это широта способностей; ASI это уровень. Склейка выгодна лабораториям по вполне земным причинам: она автоматизирует их главный актив, оправдывает капитал, переносит финишную черту под их контроль и совпадает с их порогами безопасности.

Наверняка в ближайший год кто-то из крупных игроков объявит внутреннюю систему, удовлетворяющую его собственному определению AGI через автоматического исследователя, и сделает это раньше, чем появятся независимо воспроизводимые доказательства устойчивого RSI.

Практический вывод: надо смотреть на воспроизводимые замеры с учётом стоимости вычислений, на способность систем выбирать задачи, а не только исполнять их, на то, фиксирует ли компания бюджет вычислений в своих заявлениях о продуктивности.
А твиты со знаком равно между AGI и RSI, графики без доверительных интервалов, метрики вроде строк кода, оценки продуктивности по ощущениям пользователей игнорировать.
  • ❤ 1
  • 🔥 1
Post #195 216
В июле 2025 года METR провела рандомизированный контролируемый эксперимент: 16 опытных разработчиков, 246 задач, данные февраля по июнь 2025 года, инструменты Cursor Pro с Claude 3.5 и 3.7 Sonnet. Результат дословно: разрешение использовать ИИ увеличило время выполнения на 19 процентов, с доверительным интервалом примерно от плюс 2 до плюс 39 процентов, при том что после эксперимента те же разработчики оценивали ускорение в 20 процентов. Один эксперимент не приговор, и сама METR отмечает, что это замер начала 2025 года. Но он показывает, как легко спутать ощущение ускорения с ускорением, и почему ощущения плохой измеритель.

4. Что говорят данные о темпе, и как их читать? METR измеряет временной горизонт задач: длину задачи по человеческому времени, которую модель решает с вероятностью 50 процентов. Этот горизонт удваивался примерно каждые семь месяцев в 2019 по 2025 годы, а на данных 2024 по 2025 удвоение выглядит ближе к четырём месяцам. Anthropic на странице When AI builds itself приводит именно эту ускоренную оценку и добавляет внутренние данные: более 80 процентов кода, вливаемого в кодовую базу Anthropic на май 2026 года, написано Claude, Anthropic а типичный инженер во втором квартале 2026 года вливал в 8 раз больше кода в день, чем в 2024 году Anthropic.

Строки кода это количество, а не качество, и Anthropic честно оговаривает, что величина 8x почти наверняка завышает реальный прирост продуктивности. Кривая METR очень чувствительна к нескольким длинным задачам, а человеческие базовые времена измерены лишь для малой части самых длинных задач. Но это не доказательство того, что машина сама выбирает направления исследований. Именно выбор целей Anthropic называет своим главным оставшимся разрывом.

И ещё один датапоинт против прямолинейной экстраполяции. Дэниел Кокотайло, ведущий автор сценария AGI 2027 (апрель 2025), к концу 2025 и в 2026 году сдвинул свою медиану ближе к 2029 и 2030 годам, потому что прогресс идет несколько медленнее сценария. Скептики вроде Эге Эрдиля и Тамая Бесироглу из Epoch AI держат горизонт AGI за 2045 годом и не считают интеллектуальный взрыв правдоподобным, хотя допускают взрывной экономический рост.

5. Что реально засчитывалось бы как доказательство? Нужен повторяемый рост исследовательской способности на протяжении нескольких поколений моделей, измеренный с учётом двух вещей: человеческого вклада и стоимости вычислений. Конкретно я бы смотрела на следующее:
- Растёт ли способность модели самостоятельно выбирать направления исследований, а не только исполнять поставленные эксперименты, ведь именно этот разрыв называет своим Anthropic.
- Сохраняется ли ускорение, когда вы фиксируете бюджет вычислений, а не наращиваете его.
- Держится ли эффект на нескольких поколениях подряд, а не на одном удачном релизе.
- Подтверждается ли он контролируемыми замерами вроде METR, а не опросами и ощущениями.

Пока хотя бы часть этих условий не выполнена, разумно считать, что мы видим ускорение отдельных задач, ровно как и написала сама OpenAI 9 сентября 2026 года.
metr.org Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity We conduct a randomized controlled trial to understand how early-2025 AI tools affect the productivity of experienced open-source developers working on their own repositories. Surprisingly, we find that when developers use AI tools, they take 19% longer than…
  • ❤ 3
Post #194 198
b) Оценки фронтиер-лабораторий 2025 и 2026 годов огромны. OpenAI 2 октября 2025 года завершила вторичную продажу акций на 6,6 миллиарда долларов при оценке 500 миллиардов долларов, из авторизованных 10,3 миллиарда, обогнав SpaceX как самая дорогая частная компания мира. Anthropic закрыла раунд Series G на 30 миллиардов долларов 12 февраля 2026 года при post-money оценке 380 миллиардов долларов, ведущие инвесторы GIC и Coatue. xAI закрыла увеличенный раунд Series E на 20 миллиардов долларов 6 января 2026 года при оценке около 230 миллиардов долларов, причем сама компания подчеркнула, что раунд превысил целевые 15 миллиардов. Обещание цикла самоулучшения оправдывает такие капитальные затраты лучше, чем обещание еще одного полезного продукта.

c) Контракт OpenAI и Microsoft показал, как дорого стоит определение AGI. По условиям реструктуризации октября 2025 года объявление AGI со стороны OpenAI теперь проверяет независимая экспертная панель, права Microsoft на интеллектуальную собственность продлены до 2032 года и включают модели после AGI, а выплаты доли доходов идут до 2030 года. Определение AGI стало юридическим переключателем на десятки миллиардов долларов, и лаборатории заинтересованы контролировать его формулировку.

d) Порог RSI совпадает с их собственными порогами безопасности. Политика Anthropic Responsible Scaling Policy вводит уровни AI R&D-4 и AI R&D-5: первый это способность полностью автоматизировать работу младшего исследователя, второй это способность вызвать резкое ускорение разработки ИИ, то есть фактически RSI, и он требует уровня защиты ASL-4. У OpenAI критический порог AI Self-improvement определён похоже: сверхчеловеческий исследовательский агент или сокращение времени смены поколения модели в пять раз, удерживаемое несколько месяцев. Когда безопасность и объявление AGI завязаны на один и тот же порог, удобно называть его главным, потому что тогда история про безопасность и история про победу рассказываются в одной терминологии.

Но положительная обратная связь не равна неограниченному росту. Монотонно возрастающая последовательность может иметь конечный предел: сумма ряда ½ + ¼ + ⅛ + … растёт на каждом шаге, но никогда не превышает единицы - это предел данной функции. Вопрос не в том, каков коэффициент усиления улучшения и где стоят ограничители. Ограничителей несколько, и по ним есть данные.

Вычисления
Многие сценарии программного интеллектуального взрыва предполагают, что софт улучшает софт без нового железа. Но серьёзные эксперименты требуют вычислений уровня обучения передовой модели, а рост вычислений упирается в физику, энергию и сроки поставки. Экономическая работа 2025 года показала, что при определённой связи между экспериментами и идеями вычисления становятся жестким узким местом, arxiv и программное ускорение живёт лишь до этого предела.

Идеи становится всё труднее находить
Это известный результат экономики роста: чтобы поддерживать постоянный темп улучшений, нужно вкладывать всё больше исследовательских усилий. Даже сторонники сценария взрыва у Forethought оценивают отдачу так, что одно удвоение когнитивного труда даёт около 1,2 удвоения выхода в среднем, с широким разбросом от 0,4 до 3,6. Если параметр ближе к нижней границе, “взрыва” не происходит вовсе, а происходит затухание.

Эксперимент и проверка
Даже идеальный автоматический исследователь должен ставить опыты и ждать результатов. Обзор Epoch AI прямо отмечает, что эксперименты не "серебряная пуля", потому что модель может быть ошибочной, а бенчмаркинг требует полного цикла обучения, доступного лишь горстке игроков.

Физическое строительство
Дарио Амодеи, оптимист, в эссе Machines of Loving Grace (октябрь 2024) признает, что даже целая страна гениев, живущая 24/7 в дата-центре, упрется в физические и практические пределы, например в скорость биологических экспериментов. Его формулы powerful AI и country of geniuses in a datacenter намеренно избегают слова AGI.

Человеческий вклад и стоимость
The Official Microsoft Blog The next chapter of the Microsoft–OpenAI partnership Since 2019, Microsoft and OpenAI have shared a vision to advance artificial intelligence responsibly and make its benefits broadly accessible. What began as an investment in a research organization has grown into one of the most successful partnerships in…
Post #193 194
В октябре 2025 года Сэм Альтман в прямом эфире и затем в посте на X сформулировал внутренние цели OpenAI: автоматический стажер-исследователь к сентябрю 2026 года и полноценный автоматический исследователь к марту 2028 года. В начале сентября 2026 года OpenAI сообщила, что цель по стажеру достигнута: система выполняет четко поставленные исследовательские задачи под руководством человека, включая те, что заняли бы у специалиста несколько дней. Обратите внимание на осторожную формулировку: там нет слова AGI, там есть слово стажёр, и там есть слова под руководством человека.

Параллельно журналисты и сами лаборатории начали подменять термин. В мае 2026 года TechCrunch прямо написал, что RSI стал новым AGI, и что его так же трудно определить. В августе 2026 года TIME описал внутреннюю систему OpenAI под именем Astra и связал разговоры про AGI именно с петлёй самоулучшения: модель, которая ускоряет собственные исследования, называется recursive self-improvement. Так возникла та самая склейка: раз порог AGI спорен, давайте измерять его через способность вести исследования ИИ.

Проверим четыре утверждения из исходной заметки по первоисточникам:

a) Страница Anthropic Institute When AI builds itself действительно описывает RSI как систему, способную полностью автономно проектировать и строить своего преемника, и прямо говорит, что мы ещё не там и что RSI не является неизбежным Anthropic. Более того, Anthropic называет конкретный оставшийся разрыв: Claude уже сопоставим с человеком в исполнении хорошо поставленного эксперимента, но большие разрывы сохраняются, когда речь идёт о выборе целей, то есть о выборе направлений исследований.

b) Устав OpenAI (OpenAI Charter) определяет AGI как высокоавтономные системы, превосходящие людей в большинстве экономически ценных работ. Формулировка подтверждается дословно. Это определение про экономику труда, а не про самоулучшение, и в нём нет ни слова про то, что система должна строить своего преемника.

c) AlphaEvolve от Google DeepMind (май 2025) действительно улучшил вычислительные процессы, включая обучение самой Gemini: он ускорил ключевое ядро матричного умножения на 23 процента, что дало сокращение общего времени обучения Gemini примерно на 1 процент Google DeepMind. Это подтверждается первоисточником DeepMind. Небольшая точность: 23 процента и 1 процент это не два независимых достижения, а одно, выраженное на двух уровнях, ядро и полный цикл обучения. Отдельно AlphaEvolve ускорил ядро FlashAttention примерно на 32,5 процента, но это уже про инференс и обучение вообще, а не про самоулучшение конкретно.

d) 9 сентября 2026 года OpenAI в тексте The AI policy window is open заявила, что полностью автономного RSI сегодня не существует, OpenAI и отделила его от ускорения отдельных исследовательских задач. Дословно смысл такой: ИИ уже ускоряет части исследований, но это не recursive self-improvement, а свидетельство направления движения.

Никто из серьёзных авторов не написал, что AGI равно RSI, знак равенства ставят таблоиды и твиты.

3. Почему лабораториям удобно приравнять AGI к RSI?

a) Это автоматизирует их следующее конкурентное преимущество, тк ценность лаборатории в её исследователях. Если определить главный порог как автоматического исследователя, то гонка идёт ровно за тем активом, который у лабораторий уже есть и который они лучше всех умеют масштабировать, и получается, это удобное определение вершины для того, кто уже лидирует именно в этом.
X (formerly Twitter) Sam Altman (@sama) on X Yesterday we did a livestream. TL;DR: We have set internal goals of having an automated AI research intern by September of 2026 running on hundreds of thousands of GPUs, and a true automated AI r…
Post #192 228
В сентябре 2026 года в отрасли снова спорят о том, что считать искусственным интеллектом человеческого уровня — artificial general intelligence (AGI). Появился удобный ответ: AGI наступит тогда, когда ИИ сам сможет вести исследования ИИ и создавать своего преемника, то есть при достижении рекурсивного самоулучшения или recursive self-improvement (RSI).

1. Начну с определений, чтобы не потеряться на смешении понятий.
AGI (artificial general intelligence) описывает широту способностей: система считается общей, когда она справляется с большинством экономически ценных задач на уровне человека.
RSI (recursive self-improvement) описывает механизм развития: система улучшает саму себя или своего преемника, и каждое улучшение облегчает следующее.
ASI (artificial superintelligence) описывает уровень способностей: система превосходит всех людей практически во всём. Эти три оси:

• широта способностей,
• механизм развития
• и уровень способностей

логически независимы друг от друга. Можно представить себе очень общую систему, которая не умеет вести собственные исследования, и узкую систему, которая отлично улучшает один класс алгоритмов и при этом бесполезна в остальном. Когда кто-то говорит, что AGI будет достигнут при достижении RSI, он склеивает все три оси

Полезно держать в голове рамку Google DeepMind из работы Морриса и соавторов (Morris et al., Levels of AGI, 2023), где способности раскладываются отдельно по глубине (performance) и по широте (generality), а автономность вынесена в третье измерение. Определять AGI через RSI означает заранее гарантировать себе право объявить победу, когда заработает средство, даже если сама цель, широкая человекоподобная способность, еще не достигнута.

2. Сама идея AGI via RSI не новая. Ещё в 1965 году И. Дж. Гуд в статье Speculations Concerning the First Ultraintelligent Machine описал интеллектуальный взрыв, написав дословно, что сверхразумная машина могла бы проектировать еще лучшие машины, и что первая такая машина станет последним изобретением, которое человеку нужно будет сделать, при условии что машина достаточно послушна, чтобы объяснить нам, как держать её под контролем. Оговорка про контроль в этой цитате теряется, а зря. Современная версия идеи звучит посуше и коммерчески более точной.
  • ❤ 3
Post #191 408
Ещё в 2025 году OpenAI заявляла, что обнаружила признаки использования её моделей для дистилляции. В феврале 2026 года Anthropic опубликовала намного более конкретные данные: по её утверждению, DeepSeek, Moonshot и MiniMax вели против Claude дистилляционные кампании промышленного масштаба, более 24 000 фродовых аккаунтов и более 16 миллионов exchanges, и извлекались не случайные ответы, а дорогие кластеры возможностей: coding, reasoning, tool use, agents, grading, computer use. В Twitter Anthropic написала почти теми же словами: “16 million exchanges with Claude, extracting its capabilities to train and improve their own models.” Термин knowledge extraction здесь точнее, чем model stealing, потому что копировать веса никто не обязан, достаточно скопировать полезную функцию.

Отсюда возникает неудобная конструкция: фронтиер лабы сами постоянно используют дистилляцию, потому что это лучший известный способ сделать дорогой intelligence дешёвым, и одновременно стараются не дать дистиллировать себя. На техническом уровне это не лицемерие, разница в том, кто владеет учителем и имеет ли право использовать его ответы для обучения конкурента, но с точки зрения самой технологии происходит одно и то же: сильная модель производит supervision, на котором становится сильнее другая модель. Поэтому API перестал быть просто интерфейсом к продукту и стал каналом утечки возможностей, и чем больше вы отдаёте наружу (сырые логиты, пути ризонинга, оценки судьи, миллионы unrestricted-запросов), тем дешевле конкуренту построить студента. Ограничения API, rate limits, скрытые chain-of-thought, мониторинг координированных аккаунтов и запреты на competitive model training в лицензиях получают вполне понятную экономическую причину. Clément Delangue, CEO Hugging Face, в этом году писал, что его не удивит сценарий, где фронтиер лабы начнут сильнее ограничивать API и направят дефицитные вычисления прежде всего на собственные продукты.

Что из этого следует

Мы привыкли читать названия GPT, Claude, Gemini, Llama как отдельные законченные сущности: компания обучила GPT-6, значит GPT-6 и есть её intelligence. Реальности это соответствует всё хуже, потому что лаборатория выглядит скорее как непрерывный конвейер интеллекта: огромные training runs > чекпойнты > reinforcement learning > синтетические данные > учителя > критики > верифайеры > дистилляция > tool scaffolding > test-time compute > production deployment, а название модели, которое видит пользователь, это одна точка на этом конвейере, выбранная по соображениям стоимости и риска.

Поэтому формулировка вопроса «какая сегодня самая умная модель» не очень удачная. Содержательные вопросы другие: какой максимум возможностей уже существует внутри лаборатории, какая его часть есть в research-чекпойнтах, какая уже скрыта в публичных весах и ждёт нормального scaffolding, какую часть удалось дёшево дистиллировать в production. И главный: насколько далеко реальный фронтиер ушёл вперёд от того, что видит человек, открывающий новый чат — лидерборд публичных моделей не является показателем возможностей AI.
  • ❤ 6
  • 🔥 4
Post #190 322
В 2026 году в математических статьях начала регулярно появляться очень необычная формулировка. 31 марта группа математиков опубликовала работу с решениями трёх задач Эрдёша, где в abstract прямо написано: “in each case, the proof is due entirely to an internal model at OpenAI.” Это не единичный случай: в феврале внутренняя модель OpenAI построила новое решение задачи Эрдёша, Нешетрила и Рёдля, в апреле вышла ещё одна работа с пятью доказательствами, полученными таким же образом, а затем внутренняя модель OpenAI нашла контрпример к гипотезе Эрдёша о unit distances, открытой около восьмидесяти лет, и доказательство проверили внешние математики. В сопутствующей статье указано, что первоначальный математический результат был сгенерирован в один проход внутренней моделью, после чего люди переработали изложение через Codex. W. T. Gowers написал, что если бы такое доказательство прислал человек, он без колебаний рекомендовал бы его к публикации в Annals of Mathematics. Mehtaab Sawhney в Twitter сформулировал это ровно так: “the solution was found by an internal model at OpenAI”, а Kevin Weil, тогда один из руководителей OpenAI, репостнул с комментарием, что AI решает всё больше открытых задач и доказательства становятся элегантнее по мере улучшения моделей. То есть существование моделей, которыми компания пользуется внутри задолго до публичного релиза, здесь уже не спекуляция, оно написано в математических статьях.

При этом несколько месяцев спустя Noam Brown из OpenAI рассказывал эту историю иначе, чем ее обычно пересказывают: компания просто обучила новую внутреннюю модель и решила посмотреть, что она умеет, контрпример нашёлся при относительно небольшом бюджете на инференс, но после публикации люди обнаружили, что примерно тот же путь вытаскивается и из уже публичной GPT-5.5, если правильно построить scaffolding. Значит, между «внутренняя модель умеет это» и «публичная модель не умеет этого» жёсткой границы может не быть вовсе: возможность уже находится внутри публичных весов, но остается латентной, пока не подобран правильный prompt, search strategy, верифайер или test-time compute. Отсюда следует, что «насколько умна модель» перестает быть свойством одних только весов и становится свойством связки модель + scaffolding + инструменты + бюджет на инференс + верифайер + search strategy + пост-трейнинг, а обычный чат-интерфейс оказывается довольно плохим прибором для измерения реального фронтиера возможностей.

Что тогда с Astra

С Astra получился почти естественный эксперимент. До публичного релиза OpenAI уже использовала очень сильные внутренние модели в research, а 3 сентября 2026 года выпустила GPT-6 Astra и назвала её the most capable broadly deployed model: 98% на FrontierMath Tier 4 и, по заявлению компании, участие в решении давних математических задач. Вполне возможно, что то, что несколько месяцев назад в статье называлось просто внутренней моделью, относится к той же технологической линии, которая позже стала Astra. Но это мой вывод по косвенным признакам: OpenAI не раскрыла происхождение этих чекпойнтов настолько подробно, чтобы можно было честно провести стрелку от конкретной внутренней математической модели к Astra. Тем более из этого не следует, что где-то внутри уже существует модель на поколение сильнее Astra. Это вполне возможно, но доказательств этого пока нет.

Обратная сторона дистилляции или феномен DeepSeek

Вы потратили миллиарды на вычисления, исследователей, RL, синтетические данные и eval infrastructure, а конкуренту для воспроизведения заметной части результата достаточно вытянуть несколько миллионов качественных ответов вашей модели через API. Ему не нужны ваши веса и необязательно понимать вашу архитектуру, он использует вашу модель как учителя, генерирует миллионы заданий, собирает ответы, фильтрует лучшие траектории ризонинга, обучает свою модель, потом использует вашу же модель как судью и повторяет цикл. Экономика получается перекошенная: вы платите за создание intelligence, конкурент платит за API-токены, чтобы этот intelligence перенести.
  • 👍 6
Post #189 305
Что за зверь "internal OpenAI model" и почему DeepSeek догоняет OpenAI?

Публике не доступны внутренние модели фронтиер лабораторий. Я не очень верю про конспирологию в духе «у OpenAI в подвале сидит настоящий AGI, а наружу выдают обрезанный ChatGPT». Модель, которой пользуются её собственные исследователи, и модель, которую она продает вам через API, не обязаны быть одной и той же. Фронтиер лаба создает не одну нейросеть, а фабрику моделей: research-чекпоинты > экспериментальные модели > reward-модели > модели-учителя > модели для генерации синтетических данных > модели-evaluators > дистиллированные студенты > production-модели, и наружу попадает только последний элемент цепочки.

Зачем нужна дистилляция

Допустим, вы обучили чудовищно дорогую модель, которая хорошо рассуждает, пишет код и решает математику, но каждый запрос к ней стоит огромных вычислений. Для исследователя внутри компании это рабочий инструмент, и он того стоит, если на кону триллионные рынки. Для продукта со 100 млн пользователей масштабировать доступ к таким моделям выгодно, поэтому вместо того чтобы гонять её на каждом запросе, её делают учителем: она генерирует качественные ответы, решения, траектории ризонинга, синтетические данные, иногда сами распределения вероятностей, а на этом поведении обучается студент поменьше, которому не нужно воспроизводить учителя целиком, достаточно перенести нужные возможности. Это одна из форм дистилляции знаний, и практика настолько распространенная, что OpenAI прямо предоставляет разработчикам официальный Model Distillation workflow: брать ответы более сильной модели, например GPT-4o или o1-preview, и обучать на них модель дешевле. Формулировка самой OpenAI довольно точная: взять продвинутую модель и получить сопоставимое качество на конкретной задаче при существенно меньшей стоимости. Из этого следует довольно простая вещь: лучшая research-модель и лучшая production-модель оптимизируются по разным функциям, потому что research-модель максимизирует возможности, а production-модель приходится одновременно вытягивать по intelligence, latency, стоимости GPU, throughput, reliability и safety.

Публичных примеров такой схемы за последние два года накопилось довольно много. Apple описывала внутреннего Mixture-of-Experts учителя, которого использовала при обучении своей небольшой on-device foundation model. Google обучала EmbeddingGemma с помощью более мощного учителя Gemini. Meta использовала логиты Llama 3.1 8B и 70B при создании маленьких Llama 3.2 1B и 3B. Microsoft прямо писала, что ранние Phi в значительной степени дистиллировали возможности GPT-4. DeepSeek после обучения R1 выпустила линейку дистиллированных моделей от 1.5B до 70B. Схема «сильный учитель > дешёвый студент» реальна и хорошо задокументирована.

Чего отсюда не следует

Здесь будто бы следует неправильный вывод: якобы любая публичная модель является урезанной версией секретной супермодели. Иногда учитель вообще публичный, Meta использовала публичные Llama 3.1, DeepSeek выложила и большую R1, и дистиллированные из нее модели, причём студент иногда обходит своего учителя на конкретном бенче или узкой задаче за счет специализации и пост-трейнинга. То есть не совсем верно утверждать, что весь open source является специально ухудшенной дистилляцией секретных моделей. А вот более слабое утверждение подтверждается вполне: публичный каталог моделей почти наверняка не показывает весь фронтиер возможностей конкретной лаборатории.

«An internal model at OpenAI»
  • 👍 2
Post #187 1.73K
OpenAI утверждает, что модель не смотрела пользовательские данные и что ни исследователи, ни агенты не видели работу Buckmaster и Alpöge до ее публичной публикации.

Но.

В официальном заявлении OpenAI есть вот такая формулировка:

“While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models.”

То есть OpenAI не может исключить, что деидентифицированные данные, полученные из использования Buckmaster и Alpöge продуктов OpenAI, помогли улучшить модели.

И вот тут я хочу очень аккуратно разделить факт и мое мнение.

Мы не знаем, украла ли OpenAI их математический результат. Buckmaster этого тоже не может доказать. OpenAI это отрицает. Более того, результаты математически не идентичны: Buckmaster и Alpöge получили forced Euler, OpenAI заявляет unforced Euler и затем НС, причем утверждает, что доказательства существенно различаются.

Но лично для меня даже то, что мы знаем наверняка, выглядит крайне неэтично и очень тревожно с академической точки зрения.

Люди долго работают над передовой математикой.

Информация об их еще неопубликованном результате доходит до крупнейшей AI-компании мира.

Компания после этого направляет на соседнюю задачу 10 000 агентов, сотни миллиардов токенов и миллионы долларов компьюта и через несколько дней получает результат.

Затем один из математиков утверждает, что человек из компании предлагает схему публикации, в которой его соавтор, работающий в конкурирующей AI-лаборатории, исчезает из следующей статьи.

После отказа, по его словам, звучит:

“Why would you ruin your career?”

А потом компания сама признает, что не может полностью исключить влияние неидентифицированных данных от использования этими математиками ее продуктов на улучшение модели.

С академической точки зрения для меня это выглядит совершенно неприемлемо. И мне кажется, здесь проблема гораздо больше конкретно OpenAI.

Потому что представьте, что вы ресечер во фронтиер лабе и используете AI для работы над еще неопубликованной математикой, новым алгоритмом, лекарством или каким-нибудь материалом. Вы отдаете модели свои гипотезы, неудачные попытки, промежуточные доказательства, догадки и драфты. А компания, которой принадлежит эта модель, обладает мощностями, превосходящим ваши ресурсы на несколько порядков.

Тогда возникает довольно неприятный вопрос: что из своей неопубликованной работы ученый вообще может безопасно отдавать модели?

Причем у истории есть еще один довольно показательный эпилог.
Dheeraj Nagaraj, который сейчас работает в Google DeepMind и был интерном у Bubeck в 2020 году, увидел обвинения Buckmaster и написал, что подобное поведение для него “100% believable”, и что он рад, что “the mask is off publicly”. Это, конечно, не доказательство конкретных обвинений Buckmaster. Он не был свидетелем этих разговоров.

Если доказательство OpenAI выдержит независимую проверку, AI только что получил решение одной из проблем тысячелетия, которая оставалась открытой десятилетиями.

То есть вместо красивой истории про то, как AI и люди вместе двигают математику вперед, мы получили историю про compute race, priority, авторство, закрытые модели, пользовательские данные и… продолжение следует
  • 🤯 15
  • 🔥 9
  • ❤ 8
  • 👍 2
  • 🤬 2
  • 🤣 2
  • 👎 1
  • 🤔 1
  • 💯 1
Post #186 1.94K
В математике и AI сейчас происходит невероятный поворот. (Правда, думаю до сингулярности еще несколько менее доступных проблем тысячелетия остались). Сорри за англ.цитаты, их много.

Примерно 12 месяцев два математика, Tristan Buckmaster, профессор математики в NYU, и Levent Alpöge, математик из Anthropic, в свободное время работали над задачами вокруг уравнений Эйлера/Навье-Стокса, (НС ниже) Причем это не была работа Anthropic, они занимались этим в свободное время.

Они развивали направление Diego Córdoba и Luis Martínez-Zoroa и получили очень сильный результат: «finite-time blowup for forced 3D Euler”. В процессе они сами активно использовали AI, включая Claude и Codex, а доказательства формализовывали в Lean, а Terence Tao назвал их результат выдающимся.

И вот дальше начинается самое интересное.

В Twitter появляется виральный пост, что Anthropic якобы близок к решению двух проблем тысячелетия. Слух был неправильным: Buckmaster и Alpöge не решили две задачи тысячелетия, и вообще это была не работа Anthropic. Но OpenAI сразу взяли это на вооружение. И вот это уже не обвинение Buckmaster, а буквально написано самой OpenAI.

28 августа OpenAI начала обучать новую внутреннюю модель с очень сильными результатами по математике. 1 сентября они услышали слух про две якобы решенные задачи и решили запустить новую модель на все оставшиеся задачи тысячелетия.

Сначала около 100 агентов примерно 50 часов работали над более простой задачей и получили свой результат для unforced Euler.

После этого OpenAI решила, что НС выглядит наиболее перспективной целью, сняла агентов с остальных задач и направила ресурсы туда. Причем агентам дали полученное ими решение Эйлера как инпут для дальнейшей работы.

И дальше масштаб становится просто грандиозным. Группа, которая в итоге получила результат НС, включала порядка 10 000 одновременно работающих агентов.
На НС они отправили 2,7 миллиона сообщений и сгенерировали около 130 миллиардов токенов. Вся кампания по математическим задачам съела около 300 миллиардов токенов.

Через 88 часов, 5 сентября, система получила решение. Еще 17 часов ушло на формализацию и проверку в Lean. По данным WSJ, вычисления стоили миллионы долларов.

То есть компания услышала слух, что какие-то математики приблизились к очень большому результату, и буквально через несколько дней направила в эту область много компьюта.

Но это даже не самая стремная часть истории.

По версии Buckmaster, когда Sébastien Bubeck, руководящий математическим направлением OpenAI, уже знал об их работе, у них состоялись разговоры. И Buckmaster описывает совершенно дикую ситуацию. По его словам, ему предложили два варианта.

Первый: они с Alpöge публикуют свой результат по Эйлеру, а OpenAI вечером публикует решение НС.

Второй: после публикации Buckmaster один, уже без Alpöge, пишет paper с результатом НС и указывает, что доказательство получила внутренняя модель OpenAI. Buckmaster утверждает, что Bubeck дважды настаивал на исключении Alpöge из авторства, причем отдельно говорил, что все было бы гораздо проще, если бы Levent не работал в Anthropic.

Buckmaster отказался. И сказал, что если OpenAI опубликует результат таким образом, он публично расскажет, что произошло.

По его словам, ответ был: “Why would you ruin your career?”

Они это сказали не аспиранту, которого можно напугать потерянной карьерой, а профессору математики NYU, который много лет занимается именно этой задачей.

Bubeck эту версию оспаривает. Он говорит, что обвинения ложные, что обсуждение было попыткой нормально скоординировать публикации и что он не пытался лишить Alpöge авторства его собственной работы.

Но дальше возникает еще один, на мой взгляд, гораздо более фундаментальный вопрос.

Buckmaster и Alpöge сами использовали Codex во время работы над этой неопубликованной математикой. По словам Buckmaster, они складывали туда драфты практически всего проекта.

Поэтому Buckmaster прямо спросил OpenAI: была ли их внутренняя модель обучена на этих сессиях или имела к ним доступ?
  • ❤ 12
  • 😱 10
  • 🔥 3
  • 👍 2
Post #185 1.35K
Хочу поделиться игрой, которая важна для меня и для Algebras AI, знаю, что мои подписчики играют в похожие игры!

Алексей Герасимович, CPO Eschatology Entertainment, в прошлом R&D Director Wargaming, запускает новую игру - Guns of Eschaton - при поддержке паблишера 4Divinity.

Хотя мы не делали локализацию для него, Леша в течение года менторил нас и вложил много сил в наш стартап. Поэтому хочу его поддержать.
Игра очень красивая. Пожалуйста, ставьте лайки, шэры и самое главное — добавьте игру в вишлист.

https://store.steampowered.com/app/3734220/Guns_of_Eschaton/
Steampowered Guns of Eschaton on Steam The world’s first soulslike FPS pulls you into an apocalyptic Western by the legendary Viktor Antonov: a land of dust, blood, and horror. Study your enemies, count your bullets, forge your own style with gunpowder and prayers. Solo or in co-op—go West, gunslinger…
  • 👍 6
  • 🤔 1
Post #184 1.48K

Forwarded from ChillHouse (Alexey Moiseenkov)

Ну наконец-то понятно на что дали два ярда thinking machines

Interactive models. Если кратко моделька которая вас слушает в риал тайме и сразу там в фоне решает че надо сделать. Сама меняет поведение пока вы с ней говорите.

Радует что хоть кто-то уходит из этого убогого чат интерфейса. Наконец-то.

Видео
  • 👍 3
Post #183 1.64K
😁😆😁 AI will take over your jobs. AGI is coming tomorrow.
  • 😐 9
  • 🎉 4
  • 🤨 2
Post #181 1.44K
Андрей Карпаты, известный ИИ-просветитель, бывший исследователь Tesla, создал новую соцсеть. Завела аккаунт) https://karpathytalk.com/user/ayranamo
  • 👍 3
  • ❤ 2
Post #179 1.35K
Как вам сайд-квест Милы Йовович в разработке? Ее первый проект в GitHub ⭐️ https://github.com/milla-jovovich/mempalace
2026 год продолжает удивлять
  • ❤ 7
Older posts →

About this channel

How can I read @airamongush without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Айра Монгуш — AI, tech & math: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Айра Монгуш — AI, tech & math have?
Айра Монгуш — AI, tech & math (@airamongush) has 984 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Айра Монгуш — AI, tech & math know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →