Канал про Data Science и BigData.
Для связи: @ermakovpetr
Post #225
1.27K
OpenAI открыла веса двух моделей под Apache 2.0: gpt-oss-120b и gpt-oss-20b. Они ориентированы на реальное применение, сильны в reasoning и tool use, и доступны для коммерции.
Производительность и железо.
• 120b показывает «почти паритет» с o4-mini на core-бенчмарках и работает на одном 80 GB GPU (H100).
• 20b сопоставима с o3-mini и запускается в ~16 GB памяти — вариант для edge/on-device.
Архитектура.
Mixture-of-Experts (MoE): 117B/21B параметров, но активных — 5.1B и 3.6B; RoPE, контекст до 128k.
Обе модели отдаются нативно MXFP4: 120b укладывается в 80 GB, 20b — в 16 GB.
Формат ответов и reasoning-уровни.
Используют harmony response format; поддерживают переключение «Reasoning: low/medium/high». (Важно: CoT доступен для разработчиков)
Функции: function calling/Structured Outputs, web-browsing, Python-выполнение — для агентных сценариев.
Готовы к запуску через Transformers/vLLM, а также Ollama и LM Studio; доступны через крупных inference-провайдеров (HF, Groq, Fireworks, Together, Cerebras и др.).
Microsoft добавляет оптимизированные сборки 20b на Windows (ONNX Runtime, Foundry Local, AI Toolkit for VS Code).
Модели прошли расширенные safety-оценки (включая тесты adversarial fine-tuning) и показывают сопоставимые с «фронтирными» моделями результаты на внутренних метриках; запущен Red Teaming Challenge с призовым фондом $500k.
Производительность и железо.
• 120b показывает «почти паритет» с o4-mini на core-бенчмарках и работает на одном 80 GB GPU (H100).
• 20b сопоставима с o3-mini и запускается в ~16 GB памяти — вариант для edge/on-device.
Архитектура.
Mixture-of-Experts (MoE): 117B/21B параметров, но активных — 5.1B и 3.6B; RoPE, контекст до 128k.
Обе модели отдаются нативно MXFP4: 120b укладывается в 80 GB, 20b — в 16 GB.
Формат ответов и reasoning-уровни.
Используют harmony response format; поддерживают переключение «Reasoning: low/medium/high». (Важно: CoT доступен для разработчиков)
Функции: function calling/Structured Outputs, web-browsing, Python-выполнение — для агентных сценариев.
Готовы к запуску через Transformers/vLLM, а также Ollama и LM Studio; доступны через крупных inference-провайдеров (HF, Groq, Fireworks, Together, Cerebras и др.).
Microsoft добавляет оптимизированные сборки 20b на Windows (ONNX Runtime, Foundry Local, AI Toolkit for VS Code).
Модели прошли расширенные safety-оценки (включая тесты adversarial fine-tuning) и показывают сопоставимые с «фронтирными» моделями результаты на внутренних метриках; запущен Red Teaming Challenge с призовым фондом $500k.
- 🔥 11
- ❤ 1





