Тема ради которой, я захотел завести ТГ канал.
Хочу рассказать, за счет чего происходит такой сумасшедший прогресс в ИИ.
Да, в него вливают миллиарды долларов, но на деньги интеллект не купишь. На деньги можно купить GPU, и, кажется, вот на GPU уже можно купить интеллект. К делу.
Весь прогресс можно объяснить всего двумя эмпирическими законами
1) Закон Мура, а точнее закон экспоненциального падения стоимости вычислений (он на картинке). Модель GPT2, которая была невероятным прорывом 5 лет назад, сейчас может воспроизвести любой студент с бюджетом в 30$. Через пару лет я тоже самое напишу, но уже для GPT3.
2) Закон масштабирования, он же scaling law, изначально предложенный в статье Henighan, Kaplan, et al, 2020. Он говорит, что функцию потерь можно достоверно уменьшать, наращивая размер модели/датасета. Это вам обойдется увеличением вычислительных мощностей, но они то дешевеют!
Исходя из этих 2 законов, что вам нужно делать сейчас.
1) Использовать архитектуры, которые могут аппроксимировать самые богатые зависимости за самые маленькие деньги. Которые могут легко обучаться градиентными методами. Сейчас это трансформеры, альтернативы пока нет.
2) Заваливать эти архитектуры железом и данными.
3) Получать удовольствие от качества ваших моделей.
Чего делать не надо:
Пытаться усидеть на старых стульях, где у вас старые архитектуры приправлены тысячью ручных правил. Такое я постоянно вижу, кстати, в индустрии чат ботов. Надо переезжать, и чем скорее, тем лучше.
Хочу сделать серию постов, которую пошло называл "дорога к AGI". Лучшего названия у меня для вас нет.
Post #9
1.15K

- 👍 10
- 🔥 5
- ❤ 4
- ❤🔥 1
- 👾 1