Минцифры и бизнес делят господдержку ИИ
Минцифры и бизнес обсудили возможность предоставления грантов и субсидий на создание датасетов для обучения больших моделей искусственного интеллекта. Тема поднималась на заседании рабочей группы 10 сентября.
Регулятор и бизнес должны согласовать решения до 30 сентября. То есть на выработку механизма распределения бюджетных денег отведено меньше трех недель.
Датасет - структурированный набор данных, подготовленный для анализа или обучения ИИ-моделей. Идея подается красиво: русскоязычные и отраслевые наборы данных смогут использовать сразу несколько исследовательских команд, что позволит сократить дублирование затрат.
Звучит разумно и даже экономно. Вопрос в том, кто эти наборы будет собирать, кто получит за это деньги и на каких условиях к ним получат доступ остальные.
Конкретики пока нет никакой. По словам источников, параметры поддержки еще не обсуждаются, оценить необходимые затраты невозможно.
Представитель вице-премьера Дмитрия Григоренко подтвердил: окончательное решение по мерам не принято. В Минцифры пояснили, что параметры, объем финансирования и сроки определят по итогам межведомственного согласования.
Представители VK и Т-Банка от комментариев отказались, Сбербанк и «Яндекс» на запросы не ответили.
Картина складывается знакомая. На той же встрече 10 сентября бизнес попросил у кабмина льготное кредитование и лизинг на покупку ИИ-чипов - серверов и графических процессоров.
Параллельно обсуждается субсидирование строительства и модернизации ЦОДов, льготная аренда и центры коллективного доступа к дата-центрам. Еще в августе звучала идея субсидировать операторам госинформсистем аренду облачных ИИ-решений. Теперь к списку добавились гранты на датасеты.
Общий объем планируемой господдержки ИИ - около 71,7 миллиарда рублей в год к принятому летом закону о регулировании отрасли. Мер становится все больше, а бюджет пока один. И каждая новая мера претендует на свой кусок.
При этом ни по одной из них до сих пор не названы ни суммы, ни критерии отбора получателей, ни механизм контроля за тем, как деньги будут потрачены.
Сами источники признают: денег недостаточно для решения всех задач. Для развития нужны вычислительные мощности, специалисты и инфраструктура применения моделей.
То есть датасеты без серверов бесполезны, серверы без специалистов простаивают, а специалисты без инфраструктуры внедрения работают в стол. Каждая мера в отдельности не решает проблему - но каждая открывает отдельный канал получения бюджетных средств.
Главный вопрос - кто окажется получателем. Большие языковые модели в России обучают считаные игроки: Сбер, «Яндекс», VK, Т-Банк. Именно они сидят в рабочих группах, именно их представители формулируют запросы на поддержку.
Малые команды и исследовательские группы вузов физически не способны конкурировать за гранты с корпорациями, у которых есть готовые юристы, отчетность и связи в профильных ведомствах.
Формулировка о «нескольких исследовательских командах», которые смогут пользоваться общими датасетами, выглядит как попытка придать программе публичный характер.
На практике велика вероятность, что наборы данных соберут за госсчет те же крупные игроки, а условия доступа для остальных пропишут так, что пользоваться ими будет сложно или дорого.
Что в итоге. До 30 сентября регулятор и бизнес должны договориться о механизме, параметров которого пока не существует даже в черновике. 71,7 миллиарда в год распределяются между чипами, ЦОДами, облаками и теперь датасетами.
Решения фактически формулируют те, кто потом эти деньги и получит, а критерии отбора появятся уже после того, как круг претендентов определится сам собой. Прозрачность процесса обеспечивается фразой «параметры определят по итогам межведомственного согласования».
Post #4619
30.1K