Каждый раз вычислительным блокам нужно снова читать огромный объём весов из памяти (которые не поменялись) чтобы произвести вычисления для следующего токена. И так снова и снова.
Ну вы поняли - узкое место не скорость вычислений, а пропускная способность между памятью и вычислительными блоками. По эффективности это похоже на наполнение ванной чайной ложкой.
В Taalas придумали как решить проблему принципиально, и хранить на кремнии сразу веса модели, и электрически прямо на этом кремнии воспроизвести процесс вычисления (на одном транзисторе и параметр хранится и на нем же умножение с ним выполняется ). Нет постоянных обращений к памяти - нет проблемы пропускной способности!
Причем процесс такого "запекания" модели в чип удалось сократить до 2х месяцев. И хотя сейчас llama зашивается сильно квантизированной (3-6 бит) следующее поколение с большим количеством битов уже на подходе.
А это значит что в перспективе ближайших лет мы вполне можем увидеть обвал стоимости токена для своего рода "LTS моделей". Т.е. за совсем свеженькую надо будет платить как и раньше, а вот за пол года "полежавшую" в несколько раз (если не степеней) меньше, и на скоростях которые мне даже представить тяжело
Глядишь и опертивку можно будет по старой цене купить которая уже не нужна будет в таких обьемах...
Чуть не забыл - вот тут можно пощупать эту запеченную в кремнии модель онлайн: https://chatjimmy.ai
Post #640
618
Work & Beer Balance В следующие лет 5 я ожидаю увидеть интересную ситуацию - представьте что станет возможным купить платку для установки в ПК на которой будет написано - GPT-6 Astra. И ей не нужны будут горы оперативной памяти или мощный процессор, но при этом она позволит вам…chatjimmy.ai chat jimmy chat jimmy LLM web interface
- 👍 10