TGViewer
Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса @dialoger_tech · 255 subscribers
Post #123 188

Forwarded from Максим Цепков (Maxim Tsepkov)

#Highload Иван Бондаренко (НГУ) Сильный искусственный интеллект у вас в подвале: как собрать мультимодальную LLM из опенсорса и настроить ее под вашу задачу. Началось все с участия в соревновании Strong Intelligence на AIJ-2023, где надо было сделать ИИ, способный понимать картинки и звуки. Базовую LLM давали организаторы, решение надо было представить в контейнере, дальше организаторы оценивали на своих тестах. Они пошли понятным путем, собрав энкодеры из open source решений. Энкодер - два такта, перекодировка изображения или звуков в вектор параметров, а потом перекодировав вектор параметров в вектор токенов для LLM. В презентации есть подробности - что использовано.

Заняли 14 место из 30, их результат не удовлетворил. И они подумали - а что можно сделать? Анализ показал проблему: энкодеры работают независимо от контекста разговора. И появилась другая идея: сделать общую модель мира во внешней базе данных и искать в нем, создавая контекст разговора, они назвали это припоминанием знаний. Для этого использована китайская ONE-PLANE, которая связывает разные модальности и превращенная в ANNOY-вектор для поиска английская википедия. Дополнительно потребовался генератор коротких подписей к рисункам - его результат фокусирует поиск, распознаватель звуков и преобразователи для речи и других видов звуков. И уже полученный в результате текст подается на вход LLM. В докладе было разобрана механика работы на конкретном примере.

Дальше надо сравнивать результаты с другими. Они сравнивали свои с разными решениями, при этом в качестве арбитра выступал ChatGPT - он оценивал качества ответов разных систем, сравнивал их ответы между собой. Получается относительно объективная метрика. И есть сравнения с разными системами, а также в конфигурациях с разными LLM. B тут оказалось, что основной фокус переносится на этап создания контекста, а мощность LLM уже не столь важна - что существенно для производительности, так как создание контекста - относительно дешевые решения.

Таким образом, компонентная архитектура - гибкий и не требовательный к железу способ управлять знаниями системы. И архитектура распознавания через припоминание имеет большее значение, чем LLM. Университет поддержал грантом, делают систему для ориентации студентов, способную отвечать на философские вопросы, типа чему стоит учиться, и на конкретные - куда нести документы.
  • 👍 2
More from @dialoger_tech
  1. Jul 1, 2026🚀 Мы на Hugging Face! Друзья, мы завели официальную страничку нашей компании Siberian Neu…
  2. May 8, 2026Интересная статья про победу наших коллег под руководством Ивана Бондаренко на IBM-овском…
  3. Mar 11, 2026💬 Встреча 💬 Тема: Почему ChatGPT ошибается? Галлюцинации генеративных моделей языка и ме…
  4. Feb 24, 2026✍️Локальный AI-ассистент Василиса — работает даже на парковке! 😱 Знаете этот страх — загр…
  5. Feb 23, 2026✍️🚀 Встречайте asr_eval: наш новый открытый инструментарий для оценки и сравнения ASR-мод…
  6. Dec 25, 2025🎉 Год прорыва: «Сибирские нейросети» в топе мировой науки! Подводим итоги 2025 года: наша…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →