TGViewer
Channel Public Channel
AI Forge – про ИИ в бизнесе

AI Forge – про ИИ в бизнесе

@ai_forge

Канал про LLMs (GPT, Claude, LLAMA) и их применение в народном хозяйстве. Автор @ax_makarov
Subscribers
258
Photos
56
Videos
9
Links
76

Showing posts older than #68 · Back to latest

Older Posts 15 shown
Post #66 292

Forwarded from AI[ex]Time (Александр Голубев)

Посмотрел интенсив GPT Week от Yandex, где ребята записали цикл лекций по всему, что связано с современными LLM: от обучения претрейна и замера его качества до финального алайнмента и ускорения инференса модели в условиях ограниченных ресурсов. В целом считаю, что материал получился качественным + изложен понятным языком, так что если хочется занырнуть во всю эту тематику, советую посмотреть. Если все лекции смотреть некогда, то подготовил вам таймкоды, где, на мой взгляд, удачно объяснены некоторые вещи:

1. Эволюция архитектуры трансформера с 2017-ого года. Довольно большая секция с разбором каждого трюка.
2. Интуиция вокруг алгоритма распределенного обучения FSDP. Если не знакомы с Data/Model/Tensor Parallelism, то посмотрите сначала объяснение их в начале лекции.
3. Способы замера качества LLM, когда правильный ответ может быть сформулирован множеством способов.
4. Применение Log-derivative trick и вывод алгоритма Reinforce. Если осознать самый базовый алгоритм on-policy RL, то дальше значительно легче будет разобраться в A2C, PPO, и т.д.
5. Техники дистилляции на примере статьи MiniLLM и интересный разбор применения прямой/обратной KL дивергенции в качестве “меры похожести” моделей. По дистилляции совсем недавно вышла новая работа, показывающая результаты лучше, можно почитать здесь обзор.
6. Базовая идея квантизации и ее развитие в популярный метод SmoothQuant.
7. Объяснение Speculative Decoding для ускорения инференса. Немного писал об этом здесь.

Это то, что с ходу захотелось вынести, а так довольно хорошо описан процесс Сбор данных -> претрейн -> валидация -> алайнмент -> деплой. На каждом этапе есть масса возникающих сложных задач, поэтому обычно над каждой работает отдельная команда.
Post #64 284

Forwarded from Psy Eyes (Andrey Bezryadin)

Mistral выпустили модель Mixtral 8x7B.

Их предыдущая опенсорсная 7B модель нашла массу применения в сообществе, и теперь они пошли дальше и представили нейронку на архитектуре MoE (Mixture of experts). Здесь используется 8 моделей с 7B параметрами, каждая из которых является экспертом в своей области, и они взаимодействуют друг с другом для решения задачи пользователя.

По неподтверждённым данным схожая архитектура стоит за GPT-4, только каждая модель у их гидры имеет сотни миллиардов параметров.

Mixtral 8x7B может работать локально, выдаёт результаты на уровне GPT-3.5, в шесть раз быстрее ламы 2, имеет контекст 32к, и дружелюбную лицензию. А силами сообщества проект раскачают и на ещё больший контекст + эффективность.

Анонс
Как работает архитектура MoE
Скачать модель для локалки
Демо
(ChatArena) - сравниваем бок о бок с другими моделями
Демо (Perplexity)
Демо (TogetherComputer)
Демо (HuggingChat)
Демо (HuggingFace)
Модель в формате MLX для компов Apple.
Герганов уже впилил в llama.cpp

Торрент:
magnet:?xt=urn:btih:5546272da9065eddeb6fcd7ffddeef5b75be79a7&dn=mixtral-8x7b-32kseqlen&tr=udp%3A%2F%http://2Fopentracker.i2p.rocks%3A6969%2Fannounce&tr=http%3A%2F%http://2Ftracker.openbittorrent.com%3A80%2Fannounce


К слову за год вышла не одна работа по MoE:
* ModuleFormer от IBM
* QMoE: запускаем LLM с более 1 трлн параметров на 8x3090.
* MoWE: архитектура с упором на малое требование к ресурсам.
* Mobile V-MoEs от Apple.
* SMoE как решение проблем MoE архитектуры.
* SMEAR градиентное обучение через слияние экспертов.
* Быть может не относится к MoE, но пусть тут будет: Ensemble-Instruct плюс Automix.
  • 🔥 1
Post #63 273
Пример AI-generated UI, который базируется на пользовательском запросе. То есть модель сначала классифицирует какой тип контента наиболее предпочтительно выдать пользователю, а дальше уже в соответствующем фрейме генерит мульти-модальный ответ с удобной навигацией

Интересно через какие этапы это проходит

1. Сначала классификация интента. На этом этапе модель понимает в какой модальности должен быть ответ: достаточно ли просто текста, нужны ли картинки, нужен ли какой-то UI для взаимодействия с данными
2. Потом доуточнение через встречные вопросы пользователю (это в дальнейшем позволит лучше сделать data-model для того контента, с которым будет взаимодействовать пользователь)
3. Потом модель генерирует PRD (product requirements) для некоторого мини-продукта, который решает пользовательскую задачу. Это позволяет понять какая функциональность должна быть: какие сценарии будет решать мини-продукт
4. А затем генерит под это layout, который описывает структуру интерфейса
5. На следующем шаге модель генерирует код на flutter для реализации пользовательского интерфейса
6. И дальше наполняет всё это контентом в соответствии с моделью данных

Ну и дальше с каждым куском контента можно также взаимодействовать и дальше продолжать в том же ключе

https://www.youtube.com/watch?v=v5tRc_5-8G4
YouTube Personalized AI for you | Gemini Google’s newest and most capable AI model – Gemini. Join Google Research Engineering Director Palash Nandy as he showcases Gemini’s advanced reasoning and coding abilities, all while exploring ideas for a birthday party. The model understands his intent…
Post #62 219
https://www.youtube.com/watch?v=UIZAiXYceBI

Выглядит потрясно, понятно, что в демке много всего, что скрыто за кадром, чтобы создать ощущение плавности и неразрывности пользовательского сценария. Но это всё наводит на мысли, что AGI уже очень близко
YouTube The capabilities of multimodal AI | Gemini Demo Our natively multimodal AI model Gemini is capable of reasoning across text, images, audio, video and code. Here are favorite moments with Gemini Learn more and try the model: https://deepmind.google/gemini Explore Gemini: https://goo.gle/how-its-made…
  • 🔥 1
Post #61 242

Forwarded from Not Boring Tech

📊 Нашел удобную и структурированную таблицу с компаниями, которые заняли свои места в ИИ-гонке. Отсортировано по разделам и подгруппам, а также отмечены главные модели.

Если о каких-то ещё не слышали — велком тестить. Пора зафиксировать лидеров в категориях на данный момент и наблюдать, как изменится поле ИИ-компаний через год!

#AI #Business | Not Boring Tech
Post #60 272
Ну и заставим котика прыгнуть, вбив в чат «Let the cat jump»
  • ❤ 2
Post #58 241
А ещё можно попросить сделать это же изображение, но в другом стиле (на картинке пример конвертации в стиль Pixar)
Post #54 317
Всё до сих пор играюсь с GPT-4V в купе с DALL-E 3. Открывается интересная возможность описать детально изображение и потом его же отрисовать заново

1) Сначала загружаем изображение и просим описать его
2) Создаем изображение в DALL-E 3 по этому описанию
  • 🔥 2
Post #48 228

Forwarded from e/acc

Даже если вдруг новость о запуске маркетплейса GPT не правда или, допустим, это случится не послезавтра а через 2 месяца, вот еще доказательство почему «промт-инжиниринг» умер.

В этой статье авторы доказывают, что обратная связь от пользователей и проактивные вопросы от LLM дают более точный результат чем, пусть даже сложный промтинг.

Единственный кейс где это не так — это гипотетический сценарий, когда кто-то изобретет формальный язык для промтов, который будет больше похож на Python, чем на английский. Но пока я ничего похожего не встречал.

Вместе с предыдущим постом, очень простой вывод: если уникальность вашего продукта и бизнеса это промтинг агентов или файнтьюнинг моделей, то ваш продукт не имеет конкурентного преимущества.
Post #47 165
Нужно быстро получить информацию из видео, но времени на просмотр нет? Поможет краткий пересказ видео от Яндекса!

Для этого необходимо скачать Яндекс Браузер на ваш Android или IOS смартфон или на компьютер Windows и Linux. Заходите в YouTube, открываете видео, нажимаете на всплывающую кнопку "Краткий пересказ" и вы увидите краткий пересказ информации из видео с таймкодами из этого видео. Сервис работает на YandexGPT и он полностью бесплатен!

Яндекс Браузер:
https://browser.yandex.ru

Пост взят с канала Полезная хрень
  • 👍 2
Post #45 179

Forwarded from e/acc

ChatGPT теперь поддерживает работу с файлами (загружай PDF и задавай вопросы) и совмещение разных модальностей в одном чате (может рисовать картинки, гуглить, писать и исполнять код в одном чате).

Для большинства это шок, потому что их стартап идея была разбита о быструю доставку качественного продукта команды OpenAI с инженерами за $600к в год.

Дабы предупредить будущий шок, давайте сразу обсудим, что ChatGPT выкатит в следующих версиях:

- подключение своих данных: Gmail, slack, WhatsApp
- общение в едином чате, который помнит все о вас. по сути - разговор с ассистентом.
- возможность соединять цепочки действий и плагинов (агенты)
- маркетплейс плагинов с монетизацией и курацией (curation, если на человеческом)
- полная мультимодальность: на вход видео, на выход голос; на вход музыку, на выход видео; на вход excel на выход диаграммы
- проактивный ИИ: сам поймёт когда и что у вас спросить или вам рассказать
- у каждого пользователя персональная модель, обученная на последних годах диалога (каждому — свою LoRA)
  • 🤡 2
Post #43 189

Forwarded from gonzo-обзоры ML статей

Питер Норвиг, соавтор классического учебника по AI, соавтор первого MOOC (который тоже был про AI) и вообще значимый человек ещё лет десять назад, которого я уже давно не слышал, вместе с вице-президентом Google Research написали статью про то, что AGI уже здесь.

Nevertheless, today’s frontier models perform competently even on novel tasks they were not trained for, crossing a threshold that previous generations of AI and supervised deep learning systems never managed. Decades from now, they will be recognized as the first true examples of AGI, just as the 1945 ENIAC is now recognized as the first true general-purpose electronic computer.

https://www.noemamag.com/artificial-general-intelligence-is-already-here
NOEMA Artificial General Intelligence Is Already Here Today’s most advanced AI models have many flaws, but decades from now, they will be recognized as the first true examples of artificial general intelligence.
Post #41 175

Forwarded from Ivan Begtin (Ivan Begtin)

Свежие картинки по LLMops Market Map от CB Insights [1]. Все эти картинки, симпатичные, но они лишь визуально иллюстрируют рынок AI/LLM/Generative AI и инвестиции в него.

Лично мне среди AI продуктов интереснее всего развитие поисковиков по данным и продукты по автоматизации (ИИзации) аналитики по данным. Уже есть несколько стартапов обещающих автоматизацию построения дашбордов на основе клиентских данных.

Ссылки:
[1] https://www.cbinsights.com/research/large-language-model-operations-llmops-market-map/

#ai #analytics #llmops
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →