В 2026 году в математических статьях начала регулярно появляться очень необычная формулировка. 31 марта группа математиков опубликовала работу с решениями трёх задач Эрдёша, где в abstract прямо написано: “in each case, the proof is due entirely to an internal model at OpenAI.” Это не единичный случай: в феврале внутренняя модель OpenAI построила новое решение задачи Эрдёша, Нешетрила и Рёдля, в апреле вышла ещё одна работа с пятью доказательствами, полученными таким же образом, а затем внутренняя модель OpenAI нашла контрпример к гипотезе Эрдёша о unit distances, открытой около восьмидесяти лет, и доказательство проверили внешние математики. В сопутствующей статье указано, что первоначальный математический результат был сгенерирован в один проход внутренней моделью, после чего люди переработали изложение через Codex. W. T. Gowers написал, что если бы такое доказательство прислал человек, он без колебаний рекомендовал бы его к публикации в Annals of Mathematics. Mehtaab Sawhney в Twitter сформулировал это ровно так: “the solution was found by an internal model at OpenAI”, а Kevin Weil, тогда один из руководителей OpenAI, репостнул с комментарием, что AI решает всё больше открытых задач и доказательства становятся элегантнее по мере улучшения моделей. То есть существование моделей, которыми компания пользуется внутри задолго до публичного релиза, здесь уже не спекуляция, оно написано в математических статьях.
При этом несколько месяцев спустя Noam Brown из OpenAI рассказывал эту историю иначе, чем ее обычно пересказывают: компания просто обучила новую внутреннюю модель и решила посмотреть, что она умеет, контрпример нашёлся при относительно небольшом бюджете на инференс, но после публикации люди обнаружили, что примерно тот же путь вытаскивается и из уже публичной GPT-5.5, если правильно построить scaffolding. Значит, между «внутренняя модель умеет это» и «публичная модель не умеет этого» жёсткой границы может не быть вовсе: возможность уже находится внутри публичных весов, но остается латентной, пока не подобран правильный prompt, search strategy, верифайер или test-time compute. Отсюда следует, что «насколько умна модель» перестает быть свойством одних только весов и становится свойством связки модель + scaffolding + инструменты + бюджет на инференс + верифайер + search strategy + пост-трейнинг, а обычный чат-интерфейс оказывается довольно плохим прибором для измерения реального фронтиера возможностей.
Что тогда с Astra
С Astra получился почти естественный эксперимент. До публичного релиза OpenAI уже использовала очень сильные внутренние модели в research, а 3 сентября 2026 года выпустила GPT-6 Astra и назвала её the most capable broadly deployed model: 98% на FrontierMath Tier 4 и, по заявлению компании, участие в решении давних математических задач. Вполне возможно, что то, что несколько месяцев назад в статье называлось просто внутренней моделью, относится к той же технологической линии, которая позже стала Astra. Но это мой вывод по косвенным признакам: OpenAI не раскрыла происхождение этих чекпойнтов настолько подробно, чтобы можно было честно провести стрелку от конкретной внутренней математической модели к Astra. Тем более из этого не следует, что где-то внутри уже существует модель на поколение сильнее Astra. Это вполне возможно, но доказательств этого пока нет.
Обратная сторона дистилляции или феномен DeepSeek
Вы потратили миллиарды на вычисления, исследователей, RL, синтетические данные и eval infrastructure, а конкуренту для воспроизведения заметной части результата достаточно вытянуть несколько миллионов качественных ответов вашей модели через API. Ему не нужны ваши веса и необязательно понимать вашу архитектуру, он использует вашу модель как учителя, генерирует миллионы заданий, собирает ответы, фильтрует лучшие траектории ризонинга, обучает свою модель, потом использует вашу же модель как судью и повторяет цикл. Экономика получается перекошенная: вы платите за создание intelligence, конкурент платит за API-токены, чтобы этот intelligence перенести.
Post #190
323
- 👍 6