Тут публікуються короткі замітки про PHP, Linux, Unit Testing, DB, OOP тощо, витяги зі статей, книг, відео, курсів та інших матеріалів.
Тепер тобі більше не потрібно перегортати тонни інформації ;)
@genkovich — написати автору каналу.
Post #204
1.47K
Anthropic випустила Opus 5.5
За словами Anthropic, на більшості задач вона працює на рівні Fable 5.1, а обходиться на 40% дешевше за Opus 5. Токени подешевшали до $4 і $20 відповідно.
📍 Фоллбеки на інші моделі
Opus 5.5 вийшла із запобіжниками, подібними до тих, що є у Fable 5.1. Запити з кібербезпеки здебільшого обробляє Opus 4.8. Запити з біології та з розробки frontier LLM передаються на Opus 5.
Звичайні пошук і виправлення багів у власному коді мають залишатись за Opus 5.5.
Для задач з кібербезпеки модель відкриватимуть рівнями через Cyber Verification Program, яку обіцяють розширити найближчими тижнями.
❓ Вимірювати стає дедалі складніше
Відрив у бенчмарках дедалі гірше показує, наскільки одна модель справді краща за іншу. Крім того, Opus 5.5 часто підозрює (!), що його тестують, і компанії через це важче передбачити його поведінку в реальних умовах. Хз як вони це зрозуміли :)
Anthropic очікує, що чим сильнішими ставатимуть моделі, тим гострішою буде ця проблема, якщо дослідники не просунуться в interpretability, тобто в розумінні того, що відбувається всередині моделі.
Виходить, що і бенчмарки можливостей, і перевірки безпеки від самого розробника дають дедалі менш точну картину. Найнадійнішим інструментом лишаються власні evals на власних задачах.
Ну що, погнали тестувати 😌
Youtube | Instagram
За словами Anthropic, на більшості задач вона працює на рівні Fable 5.1, а обходиться на 40% дешевше за Opus 5. Токени подешевшали до $4 і $20 відповідно.
📍 Фоллбеки на інші моделі
Opus 5.5 вийшла із запобіжниками, подібними до тих, що є у Fable 5.1. Запити з кібербезпеки здебільшого обробляє Opus 4.8. Запити з біології та з розробки frontier LLM передаються на Opus 5.
Звичайні пошук і виправлення багів у власному коді мають залишатись за Opus 5.5.
Для задач з кібербезпеки модель відкриватимуть рівнями через Cyber Verification Program, яку обіцяють розширити найближчими тижнями.
❓ Вимірювати стає дедалі складніше
Відрив у бенчмарках дедалі гірше показує, наскільки одна модель справді краща за іншу. Крім того, Opus 5.5 часто підозрює (!), що його тестують, і компанії через це важче передбачити його поведінку в реальних умовах. Хз як вони це зрозуміли :)
Anthropic очікує, що чим сильнішими ставатимуть моделі, тим гострішою буде ця проблема, якщо дослідники не просунуться в interpretability, тобто в розумінні того, що відбувається всередині моделі.
Виходить, що і бенчмарки можливостей, і перевірки безпеки від самого розробника дають дедалі менш точну картину. Найнадійнішим інструментом лишаються власні evals на власних задачах.
Ну що, погнали тестувати 😌
Youtube | Instagram
- 👍 19
- 🔥 5
- ❤ 2
- ❤🔥 1







