Минцифры и бизнес обсуждают выделение грантов и субсидий на формирование общедоступных русскоязычных и отраслевых наборов данных для обучения больших языковых моделей, которые смогут использовать сразу несколько исследовательских групп, чтобы избежать дублирования затрат. Общий объем планируемой господдержки отрасли составит около 71,7 млрд рублей.
Однако эксперты считают, что одних лишь датасетов недостаточно для технологического суверенитета. Для развития отечественных фундаментальных моделей критически необходимы вычислительные мощности, квалифицированные специалисты и готовая инфраструктура для внедрения решений.
Конкретные механизмы распределения средств пока не определены. Бюджет таких проектов зависит от доступности исходных данных, условий их лицензирования, объема очистки и необходимости привлечения узкопрофильных экспертов для разметки.
Post #21904
18K
- 🔥 34
- 🤮 14
- 👍 4