TGViewer
Work & Beer Balance Work & Beer Balance @workbeer · 1.54K subscribers
Post #435 1K
У майкрософта есть технология DirectStorage - которая позволяет работать GPU c SSD памятью напрямую, т.е. как со своей внутренней, минуя обращения к CPU и RAM. Только вот используется он только... в паре игр. Но железо у нас уже получается есть.

Вот бы так сделать для локальной LLM - подумал я. Найти карточку с 256 гигабайтами оперативки сложно, а SSD намного легче.

Конечно, Gen5 PCI позволяет гонять максимум 32GB/s на линию, что не идет ни в какое сравнение с скоростями памяти GPU (от 300 GB/s до более 1000GB/s) но если очень захочется качества с готовностью пожертвовать скоростью это была бы интересная бюджетная альтернатива для билда куда можно засунуть полноценную модель. Ну при условии что получится хотя бы эти 32GB/s выжать

Но все что я нашел это флаг у llama.cpp --n-gpu-layers который делает offload на диск. Это очень медленный путь через GPU -> RAM -> CPU -> SSD который direct storage призван срезать.

У Apple был эксперимент в 2023 году "LLM in a Flash" в котором им удалось сделать нечто подобное - и это дало прирост в 4-5x на iPhone, 20-25x на Mac 🤯. Но судя по всему дальше экспериментов не пошло (почему?).

А вот в опенсорсе ничего не нашлось. Может я плохо ищу? На фоне дефицита оперативной памяти это становится еще более актуальной темой, должно же быть хоть что-то
Apple Machine Learning Research LLM in a Flash: Efficient Large Language Model Inference with Limited Memory Large language models (LLMs) are central to modern natural language processing, delivering exceptional performance in various tasks…
  • 👍 5
More from @workbeer
  1. Oct 1, 2026Ищу нового хозяина для своего Starlabs Starlight 12.5" Linux планшета (хочу поменять его н…
  2. Sep 29, 2026👨‍💻 Фронтенд с AI: что можно делегировать агентам 5 октября, стартует конференция Podlod…
  3. Sep 29, 2026Ну и если вы пользуетесь продутами Proton - VPN или почтой, то вам будет интересно узнать…
  4. Sep 29, 2026Насколько она умная? В реальном RAG-сервисе ZüriCityGPT на реальном пользовательском трафи…
  5. Sep 29, 2026Есть такая LLM модель о который вы скорее всего не слышали, но она заслуживает вашего вним…
  6. Sep 28, 2026"How would you like to proceed?" спрашивает меня агнет. Сохраню для предков как у нас выгл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →