TGViewer
Life-Hack - AI Life-Hack - AI @life_hack_ai · 1.9K subscribers
Post #561 416
Энтузиаст «выжег» microGPT Андрея Карпати в FPGA и получил 53 тыс. токенов/сек

#AI #ии #microgpt

20-летний студент факультета электроники и вычислительной техники университета Торонто Лутира Абейкун выложил на GitHub проект TALOS-V2 — реализацию трансформера microGPT Андрея Карпати, целиком собранную в железе FPGA. По описанию проекта, модель выдает около 53 000 токенов в секунду на плате размером с кредитную карту — без Python, без CUDA и без какой-либо программной прослойки.

TALOS-V2 — это RTL-реализация трансформера, в которой все компоненты модели превращены в логические ячейки чипа. Эмбеддинги, механизм внимания (attention), нормализация, полносвязные слои и даже механизм выборки следующего токена сидят прямо в железе: чип сам вычисляет распределение вероятностей и выбирает следующий символ. Платформа — Intel/Altera Cyclone V (плата DE1-SoC, порядка $250–350). Веса хранятся как ROM-файлы в формате с фиксированной запятой Q4.12, управление — через переключатели и JTAG, симуляция в ModelSim детерминирована: при одном начальном значении результат повторяется бит-в-бит.

Чтобы понять, что значит "выжечь GPT в FPGA", полезно сравнить с привычной картиной. Обычно нейросеть — это веса в памяти и программа, которая их читает: процессор берет инструкцию, достает данные, перемножает, пишет результат, переходит к следующей инструкции. В TALOS-V2 этого слоя нет вообще. Веса лежат в постоянной памяти прямо на чипе, умножения и сложения выполняют логические ячейки, которые соединены проводами под конкретную архитектуру. Чип не выполняет модель — чип становится моделью. Сменить модель на другую означает пересобрать всю схему заново.

Сама идея — не академическое любопытство. В том же Торонто работает стартап Taalas, основанный в 2023 году бывшим главой Tenstorrent Любишей Баичем; в феврале 2026 года компания закрыла раунд на $169 млн (всего привлекла $219 млн). Taalas занимается ровно тем же, что Лутира на FPGA, только в кремнии и в индустриальном масштабе: их первый чип HC1 — это Llama 3.1 8B, выжженная в кристалл по техпроцессу TSMC 6 нм, со скоростью около 17 000 токенов в секунду на одного пользователя. Разница только в масштабе: TALOS-V2 — образовательный объект на 4192 параметра, HC1 — production-ускоритель для модели на 8 миллиардов параметров. Базовая идея у обоих одна: трансформер можно превратить из программы в схему — и Торонто, похоже, становится для этой идеи отдельным хабом.

Life-Hack - AI
  • 👍 5
More from @life_hack_ai
  1. Sep 25, 2026Cloudflare выложила навык, который превращает кодинг-агента в аудитора безопасности #ai #и…
  2. Sep 24, 2026Как устроены LLM: разбираем на примере 3-уровневой абстракции #ии #ai #llm Чтобы оптимизир…
  3. Sep 23, 2026ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить #owasp #redteamin…
  4. Sep 22, 2026Post #700
  5. Sep 21, 2026ИИ для создания сайта: как сделать сайт с помощью нейросети #статья #ai #полезное Лендинг…
  6. Sep 19, 2026Что умеет ассистент по умолчанию на Android — на примере Алисы AI #статья #ai На устройств…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →