На общедоступных данных из интернета модель учит общие закономерности языка. А во время следующего этапа — TTC (test-time compute) — модель учится точно и без галлюцинаций решать конкретные задачи. Для этого этапа нужны актуальные, узкоспецифические и точные данные. И вот они как раз и заканчиваются, объясняет Поснетт в своей статье для Financial Times.
Для разработчиков ИИ это плохо: обучать модели становится дороже и тяжелее. Зато для других это шанс заработать.
Прямо сейчас появляется новый рынок: компании лицензируют свои архивы данных. Например, Поснетт приводит в пример издательство учебников с архивом собственных технических мануалов. Для разработчиков ИИ такой датасет — просто подарок.
Другое решение — синтетические данные, созданные одним ИИ для обучения другого. К примеру, ИИ по картам города может создать его цифровой двойник-симуляцию. В такой среде может обучаться модель для автономного транспорта.
Ещё один эффективный подход, о котором, правда, Поснетт не пишет, но который используют многие компании, в том числе и Yandex Cloud, —
федеративное обучение. Он позволяет компаниям запускать совместные проекты по машинному обучению, не обмениваясь данными друг с другом.
Cогласились бы лицензировать свои данные?
❤️ — дополнительная монетизация не бывает лишней
😎 — лучше приберегу для себя
Post #135
191

- ❤ 6
- 🔥 4
- 😎 3