IBM показал sub-1nm чип
Часть 1
Выше постом я писал про дсотупность и важность чипов чтобы строить инфраструктуру для AI, и вот пожалуйста пост из мира железа. Попробую раскрыть важность этой новости.
25 июня IBM объявила о первой sub-1nm chip technology — 0,7 нм, или 7 ангстрем.
(уточнение): 0,7 нм — это не буквальный размер транзистора.
Современные "3 нм”, “2 нм”, “0,7 нм” — это не линейка в нанометрах, а название поколения техпроцесса. По сути это маркетинговая такая фишка Для привлечения внимания. Так что читать это как “IBM сделал транзистор размером меньше нанометра” не совсем верно.
Но сама новость от этого не становится менее важной и интересной.
Прикол в том, что IBM просто ещё раз оптимизировал и кое что уплотнил. Но при этом нчиего сам не произвел в виде конечного чипа.
IBM показал NanoStack — архитектуру, где укладка транзисторов происходит не только по площади кристалла, но и вверх, в третье измерение.
Если совсем просто: раньше мы раскладывали транзисторы как плитку на полу. А сейчас индустрия всё активнее и активнее пытается делать бутерброд из нескольких слоёв. Как это раньше было с печатными платами, да и не только с ними.
И тут вопрос, ну и что? Че тут такого?
А фишка в том что классическое масштабирование всё тяжелее и тяжелее. Уменьшать элементы дальше становится дорого, сложно и физически больно. Поэтому следующий шаг — это не тупо "сделать меньше", а "собрать плотнее".
Вот что IBM заявляет:
— почти 100 млрд транзисторов на кристалле размером с ноготь (с чей интересно)
— примерно в 2 раза выше плотность относительно их 2-нм демо 2021 года (вообще это оч круто и всег оза 5 лет)
— до 50% больше производительности при том же питании (чет мне не верится если честно)
— или до 70% меньше энергии при той же скорости (и это тоже)
— до 40% улучшение по SRAM (оч хочется верить, увидим. Так как это по сути то что хотелось бы получить в итоге)
Вот последний пункт для нас и для AI тусовки особенно важен. Ща попробую пояснить.
Кароч AI-железо упирается не только в "сколько операций в секунду". Но и в память.
Моделям нужен контекст. Контексту нужен KV cache (тут память и поедается и ее размер важен). Вычислениям нужна пропускная способность. А данным нужно быть как можно ближе к вычислениям. Чтобы был выше КПД и меньше потерь.
Post #74
99

- 🔥 4