TGViewer
AI4Dev — AI for Development AI4Dev — AI for Development @llm4dev · 5.3K subscribers
Post #259 2.29K
Сообщения о совершенствовании архитектур базовых моделей ИИ публикуются довольно часто и мы нередко задаемся вопросом об их перспективности. Ведь авторы и обозреватели нередко заявляют о радикальных преимуществах новых алгоритмов функционирования и скором вытеснении старых добрых трансформеров. Но несмотря на реальные преимущества тех или иных решений, они в целом пока не дают видимого экономического преимущества, добавляя единицы процентов к производительности моделей. Большинство новаторских моделей с трудом продвигаются в индустрию из академических исследований. Но вот недавняя публикация компании Inception сразу задела меня, заинтересовала многих с кем я говорил, и в надежде, что свершившееся заинтересует и многих читателей канала, публикую заметку по материалам упомянутой и последовавших за этим публикаций. Более того на нашем канале запланирована моя следующая лекция, посвященная детальному анализу предложенной авторами технологии и релизу готовых моделей на ее основе. Для начала о команде. Она впечатляет : "Нас основали профессора из Стэнфорда, Калифорнийского университета в Лос-Анджелесе и Корнелла — пионеры в области диффузионного моделирования и краеугольных технологий ИИ, включая Flash Attention, Decision Transformers и Direct Preference Optimization. В нашу инженерную команду входят ветераны из Google DeepMind, Microsoft, Meta, OpenAI и NVIDIA." Так в чем корень технологии? На настоящий момент известно два основных подхода к базовому принципу генеративного ИИ - это авторегрессионная модель и диффузионная модель. Позволю себе провести аналогию с двумя техниками работы скульптора, "генерирующего" свое произведение. Есть техника лепки, когда кусочек за кусочком добавляются к уже вылепленному, а есть техника высечения, когда из бесформенного в начале куска материала путем отделения кусок за куском формируется "генерируется" произведение. Так вот первая техника - это прямая аналогия работы авторегрессионных моделей GPT, а вторая техника - аналогия работы диффузионной модели. И что же сделали в Inception? Они соединили эти две технологии и сделали Diffusion LLM. теперь текст генерируется не токен за токеном, а фильтруется как из хаоса слов по группам токенов. Эффект в скорости составляет десятки раз! Наилучшие результаты по качеству получаются при генерации программного кода, поэтому свои первые модели разработчики ориентировали на работу с кодом. Так что встречайте и пробуйте (уже есть Playground) Mercury Coder Small и Mercury Coder Mini. https://www.inceptionlabs.ai/news
  • 👍 5
More from @llm4dev
  1. Sep 25, 2026Почему наука автоматизируется неравномерно? О пределах исследовательского harness рассказа…
  2. Sep 25, 2026Live stream finished (58 minutes)
  3. Sep 25, 2026🔴 Мы в эфире! ИИ уже помогает искать уязвимости. Вопрос в том, кто первым найдёт слабое м…
  4. Sep 25, 2026Live stream started
  5. Sep 17, 2026Live stream finished (1 hour)
  6. Sep 17, 2026Live stream started
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →