В чате просят прокомментировать, повлияет ли как-то на способности ИИ программировать на
1С то, что
1С опубликовала в открытый доступ всю документацию по платформе на английском языке.
Игорь Апресовов в своем канале написал: «
А это значит, что все модели уже выкачали эту информацию и уже обучились. А значит, много особенностей, которые раньше надо было объяснять скиллами, теперь можно не объяснять».
Не хочу расстраивать Игоря, но это никак не скажется на способностях любой
LLM программировать на
1С. Возможно, это хороший способ пояснить, как правильно выкладывать информацию в интернет по своим платформам программирования, чтобы ИИ реально взял ваши данные для обучения.
Если вы что-то выложили в интернет, это не означает, что это вообще попадет в конвейер обучения
LLM. Базовые очищенные языковые корпусы очень тщательно фильтруются, и туда попасть вообще нельзя. Эти датасеты определяют языковую целостность моделей.
В случае же программирования основной процесс наполнения датасетов из интернета ботами примерно следующий:
1. Боты-охотники за
seed для идей сканируют интернет, но их не интересует просто документация или код. Они ищут в первую очередь
оригинальные идеи для алгоритмов.
2. На базе
seed потом
LLM на многих языках будут писать сами чистые алгоритмы для
FIM и
SFT обучения. Проблема в том, что
1С в мировом масштабе маргинальная платформа и наверняка не попадает в конвейеры создания примеров обучения. Поэтому даже если бот заметит интересный алгоритм на
1С, то он сделает
seed по нему, а далее агенты скорее придумают на нем примеры на Python, JavaScript и еще примерно 20 основных языках и средах.
Правда, поскольку ИИ легко делает переносы знаний между языками программирования, то в этом случае возможно улучшение программирования и на
1С. Однако вы должны писать именно
seed и желательно в формате, максимально близком к датасетам
SFT моделей по программированию. Это
НЕ документация в таком виде, а нужен
задачник, т.е. много данных в виде «задача текстом — код на
1С». Причем короткие, под Full Attention, до 4000 токенов. Тогда бот сбора
seed с очень высокой вероятностью прореагирует, т.к. для него это мегаважный контекст, где он сразу видит и постановку задачи, и целевой код. И что очень важно — задача компактная и годится для
SFT. Тут точно утащат.
Второй аспект — как
LLM вообще учат синтаксис
1С. На
SFT самого
1С нет, в реальности на него идет перенос умения ИИ программировать через свойственную им генерализацию. Но повторюсь, что косвенно тут повлиять можно, создавая примеры алгоритмов по смыслу близких.
Синтаксис
1С реально модели учили только на pretraining, где боты заметили, что «тут код». Обычно для этого датасета они его не размножают через
seed на
SFT, а больше фильтруют, стараясь понять, ошибки там есть или нет.
Если Игорь думает, что
LLM изучили, как программировать синтаксис на
1С путем чтения документаций, то это популярное заблуждение. В реальности ИИ читал
ПРОСТО КОД и пытался повторять его пачками. Для усиления процесса еще применялся Fill in the Middle (
FIM), где от модели скрывали часть кода
1С в середине и просили повторить. Поэтому если вы хотите именно точности синтаксиса, то вам нужно вывалить в интернет большое количество примеров проверенного кода на
1С. Документация тут вообще роли никакой не играет. Если даже вы хотите сделать описание, то оно должно быть встроено в код как контракты к функциям
1С, чтобы бот ловли
seed для задач выпилил их легко как примеры.
✅
https://kb.1ci.com/1C_Enterprise_Platform