Пока OpenAI, Anthropic и Google соревнуются в строительстве дата-центров, бронируют гигаватты энергии и скупают миллионы GPU, назревает не самая очевидная, но фундаментальная проблема. Compute растёт экспоненциально, а вот данных для обучения ИИ становится недостаточно. По оценкам EpochAI, объём вычислений удваивается приблизительно каждые шесть месяцев, тогда как число доступных в Интернете текстов растет лишь на 3% в год.
Что делать, когда данные заканчиваются, а мощности не ограничены?
На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.
🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.
Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.
📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #data
Post #49
658

- 🔥 9
- ❤ 1
- 👍 1
- 🤩 1