TGViewer
AI на дровах 🪵 AI на дровах 🪵 @nerditru · 227 subscribers
Post #157 97
Недавно прочитал статью MIT Technology Review «The way we measure progress in AI is terrible». Она зацепила, потому что подняла тему, которая уже давно вызывает у меня вопросы: насколько объективно мы оцениваем успехи в развитии ИИ? Многие популярные бенчмарки, которые кажутся нам стандартом, на самом деле устарели или просто не подходят для оценки реальных возможностей моделей.

Согласитесь, тесты вроде "ответь на вопрос", "переведи текст" или "напиши код" — это не показатель. ИИ может идеально справляться в этих условиях, но что с реальной жизнью, где задачи нестандартны, где данные неполные, где важен контекст? Часто бывает, что, добиваясь высоких результатов в узких тестах, разработчики ИИ теряют из виду более широкую картину. И это опасно. Нам внушают, что технологии ИИ сделали рывок, но по сути, это больше про успехи в оптимизации под конкретные метрики, чем про настоящий интеллект.

В статье хорошо подмечено, что чрезмерная зависимость от количественных метрик превращает всю гонку за прогрессом в манипуляцию числами. Это как будто сдавать экзамен, зная все вопросы заранее. Да, результат будет впечатляющим, но разве он что-то значит в реальности? Более того, это мешает смотреть в будущее. Мы решаем только то, что можно легко измерить, вместо того чтобы решать то, что важно.

Лично я считаю, что проблему можно решить, но для этого нужно подходить к оценке прогресса в ИИ совсем по-другому. Мы должны создать тесты, которые отражают реальные вызовы: разнообразие данных, многозадачность, необходимость интерпретации сложных ситуаций. Кроме того, важно привлекать к оценке людей из разных сфер, которые понимают контекст применения технологий. Ведь в конце концов ИИ разрабатывается не ради самих тестов, а ради пользы людям.

Для меня особенно важно, чтобы прогресс в ИИ не был просто красивыми цифрами в презентациях, а реально помогал решать сложные проблемы. И здесь вопрос оценки прогресса — это не просто технический момент, а основа, которая определит, куда мы придем через 5–10 лет.

Статья написана по пейперу https://arxiv.org/abs/2411.12990

#ИИ #AI #искусственныйинтеллект #технологии #будущее #развитиеИИ #бенчмарки #оценкапрогресса #технологическийпрогресс #технологиибудущего
MIT Technology Review The way we measure progress in AI is terrible Many of the most popular benchmarks for AI models are outdated or poorly designed.
  • 👍 2
More from @nerditru
  1. Sep 27, 2026Тут недавно вышла Jev от TypeSafe AI, и многие обсуждали сам подход: модель не пишет текст…
  2. Sep 24, 2026photo post
  3. Sep 24, 2026По понятиям AI инжиниринга Почему модель отвечает медленно? Почему поиск по документам воз…
  4. Sep 23, 2026Просто оставлю это тут. У кого есть мысли, давайте в комменты 🖥
  5. Sep 20, 2026Post #284
  6. Sep 14, 2026Post #283
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →