SynEL
В репозитории опубликован код SynEL — синтетического бенчмарка для связывания именованных сущностей и задач извлечения знаний из текста. Авторы рассматривают практический сценарий построения графа знаний из неструктурированных данных, где нужно не только распознавать сущности и отношения, но и правильно сопоставлять найденные упоминания с записями во внешней базе знаний. Основной акцент сделан на сущностях, которые плохо представлены в обучающих корпусах больших языковых моделей. Это особенно важно для прикладных задач вроде клиентской поддержки, корпоративных баз и внутренних реестров, где встречаются малоизвестные компании и похожие по контексту названия. Ключевая идея работы — генерировать не просто синтетические тексты, а сразу тексты с заранее заданным “правильным” ответом для линковки сущностей. Вместо наивной схемы, где модель сначала пишет диалог, а потом сама пытается разметить в нём сущности, авторы сначала выбирают сущности и связи из графа знаний, а затем заставляют LLM построить диалог, в котором эти сущности естественно появляются. Это позволяет получить реалистичные диалоги с корректной привязкой к идентификаторам в базе. В работе использованы два источника данных: энциклопедический DBpedia и российский реестр компаний ЕГРЮЛ, а также дополнительная схема с псевдонимизацией реальных диалогов. Авторы отдельно проверяют качество полученной разметки вручную. На выборке из 800 диалогов синтетические данные показывают итоговый F1 по всем типам сущностей составляет около 0.97 как для английских диалогов на DBpedia, так и для русских диалогов на основе ЕГРЮЛ. Работа будет полезна исследователям LLM, специализирующихся в графах знаний и галлюцинациях, а также командам, которые строят LLM-системы для корпоративных данных, клиентской поддержки и отраслевых реестров, где особенно важна работа с редкими и слабо представленными сущностями.
статья | код
Post #155
625

- ❤ 2
- 👍 2
- 🥰 2