TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2299 244
😄 Astra решила сложную задачу о простых числах

OpenAI представила доказательство нового результата ИИ в области простых чисел, полученного GPT-6 Astra: среди бесконечной последовательности простых чисел бесконечно много раз встретятся два соседних числа, расстояние между которыми не превышает 186.

Это новый рекорд. В 2013 году Итан Чжан впервые доказал, что такая постоянная вообще существует, получив верхнюю границу — 70 млн. Джеймс Мейнард вскоре уменьшил её до 600, а коллективный проект Polymath8 — до 246. Джулия Штадльманн предложила оценку 240.

Но важно понимать, чего Astra пока не доказала. Гипотеза о простых числах- близнецах утверждает, что бесконечно часто встречаются пары с разницей ровно 2: например, 11 и 13.

Новый результат Astra говорит лишь, что бесконечно много раз расстояние между соседними простыми будет не больше 186. Каким именно минимальным окажется этот повторяющийся разрыв, мы по-прежнему не знаем.


Почему такая простая на вид задача сопротивляется математикам?

Представьте бесконечный лист бумаги с натуральными числами. Решето позволяет вычеркнуть числа, делящиеся на 2, 3, 5 и другие простые. Но нам нужно доказать не просто существование очередного простого числа, а синхронно сохранить две соседние «дырки» в решете — причём сделать это бесконечно много раз.

Здесь возникает знаменитый барьер чётности: современные методы решета плохо отличают простое число от произведения двух простых.

Поэтому математики умеют доказать, что среди набора из нескольких десятков тщательно выбранных позиций обязательно найдутся хотя бы два простых, но пока не могут подобрать две конкретные позиции с расстоянием 2.

Каждое уменьшение границы — это не перебор дополнительных чисел. Требуется лучше понять распределение простых в арифметических прогрессиях, подобрать новые веса решета и доказать, что вся конструкция продолжает работать на бесконечности.

Astra объединила оценки Polymath8 и Штадльманн с новыми условиями факторизации и численной оптимизацией.

Насколько надёжно доказательство?

OpenAI опубликовала 39-страничную работу, численный сертификат и формализацию в Lean 4. Но называть её полностью машинно проверенным доказательством пока рано. Lean подтвердил логическую цепочку при трёх явно заданных аксиомах. Две опираются на известные результаты из литературы, третья включает численные оценки, проверяемые отдельной программой. Эти входные утверждения ещё не формализованы внутри Lean.

Не раскрыта полностью и степень автономности Astra: OpenAI пишет, что доказательство принадлежит модели, но не публикует исчерпывающий протокол человеческого сопровождения. Работа также ещё должна пройти независимую математическую экспертизу.

Как Astra выглядит на фоне других моделей?

Здесь полезно различать три уровня.GPQA Diamond проверяет знание физики, химии и биологии на уровне аспирантуры. Astra получила 96% против 93,7% у Claude Fable 5.1 и 95,3% у Gemini 3.8 Flash. Это впечатляюще, но всё ещё экзамен с известным ответом.

Terminal-Bench Science ближе к работе исследователя: нужно запускать код, анализировать данные, строить модели и проводить симуляции. Astra набрала 64,6%, Claude Fable 5.1 — 52,6%, Claude Opus 5 — 30%. Однако эти цифры опубликованы OpenAI, а условия запуска моделей могут различаться.

Самая строгая проверка — независимый FrontierMath Erdős с 68 открытыми математическими задачами и обязательным доказательством в Lean. В стандартном режиме Astra решила 2 задачи из 68 — около 3%. GPT-5.6 Sol, GPT-5.5 и две версии Claude не решили ни одной. В дополнительных, уже несопоставимых запусках Astra справилась с пятью задачами, но суммарные вычислительные расходы превысили $220 тыс.

Картина получается парадоксальная. Astra уже способна иногда производить настоящую новую математику и одновременно терпит неудачу примерно в 97% строго поставленных открытых задач.

Перед нами система, которая может войти в пространство нерешённых проблем, предложить новый ход и оставить после себя доказательство, доступное для проверки человеком и машиной.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 🔥 2
  • 🏆 2
More from @testuring
  1. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  2. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  3. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  4. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
  5. Sep 16, 2026🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последн…
  6. Sep 15, 2026⚠️ Панель управления, которая собирает себя сама Runway представила Solaris — первую систе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →