Бенчмарки перестали быть чем-то полезным:
- METR уже не имеет смысла, потому что агенты делают автономную работу которая измеряется неделями человеческого времени
- ARC-AGI, все три версии полностью решены на 99%
- FrontierMath (все четыре редакции), где каждая задача заняла недели времени топовых математиков для составления решен на 98%
Мы пришли в ту стадию, где ИИ нужно оценивать только по экономическому эффекту. Я сгенерировал график роста выручки ИИ компаний за последние кварталы. Выручка это некоторый прокси пользы модели в экономике, но важно понимать что стоимость токена, который может решать одну и ту же задачу все еще падает примерно в 10 раз в год.
Например, в 2024 году модель o3 первой решила все задачи ARC-AGI и это стоило больше чем $4,500 за одну задачу. В 2026 DeepSeek V4 решает все те же задачи примерно за 2 цента на задачу. То есть, способность, появившаяся в новой модели неизбежно станет коммодити в течении года-двух и станет доступна многим. При этом, конечно, использование вырастет.
Astra является прекрасной моделью для 3D и CAD дизайна, редактирования видео и анимации, но пока еще дорогая для того чтобы запускать миллионы агентов для не-крупных компаний. Это изменится.
Вчера на интервью у Дваркеша Джон Шульман (кофаундер OpenAI) сказал что примерно 3-4 года осталось до того момента, когда модели будут лучше людей во всех когнитивных или интеллектуальных задачах. Пока что, нет никаких причин сомневаться в этих прогнозах учитывая насколько часто они были правдивы.
Вопрос в другом: как адаптировать экономику и собственную стратегию до этого момента, чтобы не остаться за бортом?
Да, очевидно, для большинства людей это будет шоком, неожиданностью и громом среди ясного неба, но вам не обязательно быть этими людьми.
Да, очевидно, это приведет к экономическим и социальным шокам, которые потребуют радикальных мер сравнимых или больших чем во время ковида.
Но здоровая реакция тут не всепропало, а попытаться адаптироваться и адаптировать других к изменениям.
Post #3231
18.9K

- ❤ 99