TGViewer
DS & ML DS & ML @sc_data · 589 subscribers
Post #2423 412

Forwarded from эйай ньюз

Microsoft выпустила Phi-3

Моделька интересная и довольно умная, есть поддержка 128к контекста, запускается на айфоне со скоростью в 12 токенов в секунду. Поздно запостил я потому что у неё подозрительно хорошие результаты бенчмарков: mini (3.8B на 3.3 триллионах токенов) версия модели тягается с LLaMa 3 8B (15 триллионов токенов), а medium - с Mistral 8x22B Instruct. По поводу моделей семейства давно ходят шутки что это из-за того что их тренируют на бенчмарках, но авторы заявляют что это из-за того что их датасет лучше всех учит модельку размышлению. Через трое суток после релиза весов возможно, что автора правы, но я все ещё жду проверки этой модели на ChatBot Arena, так как доверия бенчмаркам нет.

Предыдущие модели семейства Phi тренировали на синтетических данных, тут же, большая часть датасета - данные из интернета. Тренируют в две стадии: первая - тренировка на сильно отфильтрованных данных. На второй стадии её, как и прошлые модели, тренируют на синтетических данных, но добавляют ещё более отфильтрованную примесь данных из интернета.

Авторы пытаются отсеять данные которые LLM такого размера и так вряд ли выучит, например результаты конкретных спортивных матчей. Назвали они это Data Optimal Regime, но у него есть заметный минус: после 7B параметров качество почти не растёт, 14B моделька очень недалеко ушла от 7B модели. Тут может быть две интерпретации: первая – из датасета убрали всё, что не может понять 3B моделька (то есть что-то такое, только для LLM), вторая – модель выучила все ответы на бенчмарки, что были в датасете и насытилась. Из-за этого, хоть в пейпере речь идёт о моделях трёх размеров: mini (3.8B), small (7B) и medium (14B), пока что релизнули только самую маленькую.

--
На видео, демонстрации инференса в fp16 на M3 Max:  Вход - 131.917 tps, Генерация- 43.387 tps. Бегает шустро, но можно сделать ещё быстрее.

А вы что думаете про Phi-3?

Technical report
4k версия модели
128k версия
Тут можно початиться с моделькой

@ai_newz
More from @sc_data
  1. Apr 4, 2026ElevenLabs втоптали в землю — китайцы выпустили генератор речи OmniVoice, который может со…
  2. Aug 8, 2025Для GPT-5 вышел официальный гайд по промптам — OpenAI понятно раскидали, как выжать из нов…
  3. Aug 6, 2025🐈 Вот так неожиданность OpenAI выпустила две open source модели, сравнимые по уровню с те…
  4. Aug 6, 2025🔥 Рисовые братья выкатили нейросетевую магию — оживляет фото так, что не отличить от виде…
  5. May 11, 20259 БЕСПЛАТНЫХ курсов по работе нейросетей — с ними можно досконально разобраться в тонкостя…
  6. Apr 24, 2025Prima.cpp prima.cpp представляет собой улучшенную версию llama.cpp, позволяющую запускать…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →