TGViewer
Путеводитель по доказательной политике Путеводитель по доказательной политике @evidence_guide · 701 subscribers
Post #125 637
Подведомственное учреждение Росстата опубликовало вакансию, связанную с построением LLM под нужды Росстата, причем с развилкой - обучение модели с нуля или адаптация существующей модели. На практике развилка иллюзорна. Обучение LLM с нуля - огромные затраты на GPU (вычислительные ресурсы), разметку и подготовку корпуса текстов. Оптимально использовать и дообучать существующие открытые модели под конкретные задачи.

В описании упоминается, что задачи LLM в Росстате - генерация документов, смысловой поиск, вопросно-ответные системы, классификация, суммаризация. Задачи очень общие, но в ключе того, что сейчас делают статистические ведомства в мире (хотя разработки на порталах пока не доступны):

1) семантический поиск и генеративный ответ. Как правило, это поиск на основе метаданных, онтологий и векторных эмбеддингов с доступом через интерфейс и API. Например, в StatsChat от британского ONS веб‑страницы разбиваются на фрагменты, фрагменты переводятся в векторные эмбеддинги, и по запросу пользователя проводится поиск по базе. Результаты передаются в LLM (Flan‑T5‑Large), которая формулирует ответ только на их основе, не придумывая новые факты.

2) данные по запросу на естественном языке (text-to-SQL). Швейцарские статистики разрабатывают чат‑бота Statbot.Swiss. Пользователь задаёт вопрос на естественном языке («Сколько электрических автомобилей в Цюрихе?»), после чего система конвертирует запрос в SQL, извлекает данные из портала, строит графики и выдаёт структурированный ответ.
Аналогично проектируется IMF StatGPT - это перевод запроса пользователя в запросы к официальным API для получения статистики из баз данных, потому что ChatGPT “из коробки” при запросе экономических показателей правильно отвечает в среднем лишь в 34% случаев. AI агент класса text-to-SQL скоро будет на www.sberindex.ru.

3) автоматическая классификация и перевод кодов на новые версии классификаций. Национальный институт статистики и экономических исследований Франции Insee переводит коды экономической деятельности с NACE Rev 2 на новую NACE 2025. LLM получает список допустимых кодов и их описания, анализирует описание деятельности предприятия и выбирает подходящий код.

ClassifAI от ONS строит эмбеддинги для описаний кодов классификаций, с их помощью подбирает несколько подходящих кодов для текста (например, описания вакансии или деятельности), обращается к LLM (Gemini‑Pro) для выбора лучшего кода. Может задать уточняющий вопрос.

4) Редактирование и генерация метаданных. Банк международных расчётов BIS сделал «BIS Metadata AI Editor»на основе SDMX: статистик загружает файл метаданных, приложение генерирует исправленный дополненный вариант, дальше можно принять, отклонить или отредактировать результат.

5) Перевод кода на свободные языки программирования. Статистическое управление Ирландии разработало «SAS‑to‑R Transcompiler» на базе GPT‑4, который автоматически переводит код SAS в R, облегчая переход на открытое ПО.

6) Генерация аналитических документов. Национальный институт статистики и географии Мексики INEGI сделал прототип, в котором LLM генерирует аналитические отчёты на основе внутренних данных. Процесс состоит из 4 этапов: определить набор экономических индикаторов, получить индикаторы через API, передать результаты модели (Mixtral 8×7B) для интерпретации и сформировать текст отчёта. Все расчёты выполняются внешними скриптами, не LLM, то есть вычисления контролируемые.

Также статистики экспериментируют с таргетированной коммуникацией для разных групп пользователей, генерацией синтетических данных, аннотированием выбросов (привязка к событиям).

Всё это строится на открытых моделях, при этом даже важнее не сама LLM, а связка между AI и проверенными данными. Именно эту задачу пытается решить инициатива Global Trusted Data Commons: AI‑readiness для официальной статистики предполагает:
- использование стандарта SDMX, обогащенное описание метаданных (позволит устанавливать соответствие между, например, инфляцией и ИПЦ)
- открытые API, чтобы модели могли запрашивать статистику напрямую у первоисточника и обеспечивать неизменную точность.
  • 👍 9
  • 🔥 5
More from @evidence_guide
  1. Sep 9, 2026Вчера OpenAI заявила, что её ИИ нашёл решение “задачи тысячелетия” - задачи Навье-Стокса,…
  2. May 18, 2026📈Ищу проекты в сфере исследований, визуализации данных и картографических спецпроектов Пр…
  3. Oct 15, 2025Несмотря на огромный поток информации, мы по-прежнему многого не знаем об экономике, людях…
  4. Oct 15, 2025Объявляем старт приема работ на первый конкурс СберИндекса по дата-историям и визуализации…
  5. Oct 2, 2025Интересное применение GenAI — Research Gap Finder для поиска пробелов в исследовательских…
  6. Jun 17, 2025photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →