TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5382 3.52K
Biological Dragon Hatchling: стартап Pathway создал нейросеть с фишками мозга 🗒

Польский стартап Pathway презентовал новую архитектуру нейросетей, назвав её с пафосом — Biological Dragon Hatchling (BDH). На самом деле это серьёзный шаг в развитии ИИ. Основная идея: соединить две мощные линии развития нейросетей. Классические трансформеры и модели, вдохновлённые работой человеческого мозга.

Все мы слышали про трансформеры и их возможности, но одно остаётся неизменным: их возможности пока далеки от того, как работает человеческий мозг. В Pathway решили, что пора бы их объединить. И вот что получилось: графовая архитектура, где нейроны — это вершины, а связи между ними — синапсы с весами. То есть, модель работает как распределённая система нейронов, которые взаимодействуют только с соседями. Нечто похожее на то, как мы мыслим и учим нашу память.

А обучение в этой системе строится по принципу, похожему на правило Хебба: если два нейрона часто активируются одновременно, их связь укрепляется. Это похоже на механизм внимания, с которым мы так привыкли работать в трансформерах. А ещё, веса здесь разделены на два типа: фиксированные и динамические. Первые — это как долговременная память, они не меняются после обучения, а вторые — кратковременная память, которая обновляется с каждым шагом рассуждения.

BDH: новые горизонты и интересные фишки

Новая архитектура не только выглядит амбициозно, но и показала себя с лучшей стороны в реальных задачах. Во-первых, она удивительно интерпретируемая: каждая пара нейронов в BDH имеет свой синапс и состояние, которое можно отслеживать. Каждый нейрон отвечает за какое-то конкретное понятие, и это открывает новые возможности для объяснения того, как работает модель.

Во-вторых, BDH очень легко комбинируется с другими моделями. Простой способ конкатенации позволяет масштабировать систему, создавая всё более мощные комбинации. Ну и самое приятное: BDH демонстрирует те же свойства масштабируемости, что и GPT-2, при этом достигает той же точности на ряде задач при одинаковом количестве параметров. Модель не теряет свойства трансформеров — с каждым новым шагом она остаётся сильной и точной.


Если Pathway продолжат развивать эту архитектуру и сделают её доступной для широкого использования, её потенциал будет просто колоссальный. Но пока, как всегда, есть место для развития.

Data Science
  • 🔥 10
  • 👍 2
  • ❤ 1
More from @devsp
  1. Sep 30, 2026Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет В августе в Раздан…
  2. Sep 30, 2026Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательны…
  3. Sep 30, 2026Про Ember-1 сейчас гудят на Hacker News. Исследователи дообучили Kimi K3 так, что рассужда…
  4. Sep 30, 2026Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за од…
  5. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  6. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →