TGViewer
Channel Public Channel
KRUHLYK 🇺🇦

KRUHLYK 🇺🇦

@lets_code_ua

Subscribers
1.33K
Photos
867
Videos
88
Links
356

Showing posts older than #1488 · Back to latest

Older Posts 20 shown
Post #1487 1.26K
Маю agents, маю tokens.
Можна і попрацювати кави попити.

Гарного дня і смачної кави всім! ☕️
  • 😁 25
Post #1486 1.18K
KRUHLYK 🇺🇦 А тим часом Anthropic обісрались лажанули з безпекою пошерених чатів. Shared chats могли індексуються пошуком і доступні для всіх Там уже знаходили: - API ключі і креденшали - резюме з адресами і телефонами - внутрішні дані компаній - дуже особисті розмови…
Виявляється, що не тільки в антропіків така шляпа була. Правда ще в 2025 році.
  • ❤ 8
Post #1485 1.14K
А тим часом Anthropic обісрались лажанули з безпекою пошерених чатів.

Shared chats могли індексуються пошуком і доступні для всіх

Там уже знаходили:
- API ключі і креденшали
- резюме з адресами і телефонами
- внутрішні дані компаній
- дуже особисті розмови
Проблема банальна: не поставили noindex.

Якщо ви колись ділились чатом у Claude — краще перевірити і видали зайве:
Settings > Privacy > Your data > Shared chats > Manage

Якщо захочете перевірити то в Google це вже пофіксили, а от інші пошуковики ще поки ні.

Дякую @andpzk за інформацію.
  • ❤ 7
  • 🤯 5
Post #1484
KRUHLYK 🇺🇦 pinned «Яку модель Claude брати під яку задачу: розбір після релізу Opus 5 Anthropic випустила Opus 5, і в лінійці тепер чотири моделі. Питання «а яку з них вмикати» стало плутанішим, ніж було. Розбираю по-простому: що кому доручати, скільки це коштує і де кожна…»
Post #1483 1.29K
Яку модель Claude брати під яку задачу: розбір після релізу Opus 5

Anthropic випустила Opus 5, і в лінійці тепер чотири моделі. Питання «а яку з них вмикати» стало плутанішим, ніж було. Розбираю по-простому: що кому доручати, скільки це коштує і де кожна з них ламається.

Одразу дисклеймер: більшість цифр у релізі — це внутрішні бенчмарки Anthropic. Незалежних результатів поки мало. Тому нижче — суміш офіційних даних і практики, а не якесь імперичне знання.

TL;DR:

Sonnet 5 — ваш дефолт на 80-90% роботи.
Opus 5 — коли Sonnet не витягує: складний дебаг, архітектура, фронтенд із претензією на красу.
Haiku 4.5 — дешеві масові задачі й субагенти.
Fable 5 — рідко, для довгих автономних прогонів.

Все. Далі — деталі, чому саме так.

Скільки це коштує

За мільйон токенів (вхід / вихід):

Haiku 4.5 — $1 / $5
Sonnet 5 — $3 / $15 (зараз інтро-ціна $2 / $10 до 31 серпня)
Opus 5 — $5 / $25
Fable 5 — $10 / $50

Ключове: Opus 5 коштує рівно стільки ж, скільки попередній Opus 4.8, але суттєво розумніший. Якщо ви раніше уникали Opus через ціну — перерахуйте. Anthropic заявляє, що на їхньому бенчмарку CursorBench Opus 5 виходить у межах 0.5% від результату Fable 5, але вдвічі дешевше на задачу.

І одразу важлива думка: рахуйте не ціну за токен, а вартість завершеної задачі. Дешева модель, яка з третього разу зробила те, що дорога зробила з першого, — не дешева.

Sonnet 5: робочий кінь

Сюди йде все звичайне:

- код-рев'ю щоденних PR
- рефакторинг одного-двох файлів
- типові багфікси
- написання тестів
- документація, README
- пояснення чужого коду
- самаризація, чернетки листів

Якість — стабільно висока. Це не «економний варіант», це нормальна робоча модель. Більшість людей, які скаржаться на дорогі рахунки, просто женуть усе через Opus без потреби.

Opus 5: коли Sonnet не витягує

Ескалюйте сюди, якщо:

- дебаг складний і треба знайти причину, а не симптом
- рефакторинг зачіпає багато файлів одночасно
- потрібне архітектурне рішення
- це код-рев'ю перед релізом, де ціна пропущеного бага висока
- ви робите фронтенд і вам важливо, щоб він виглядав добре

Останній пункт — головна новина релізу. Партнери раннього доступу відзначають, що Opus 5 перевіряє власну фронтенд-роботу: відкриває сторінку в браузері на десктопній і мобільній ширині, знаходить кнопку, яка з'їхала за екран, і виправляє до того, як віддати результат. Плюс окремо хвалять анімації, 3D і загальну стабільність між прогонами.

Просте правило ескалації: якщо Sonnet двічі поспіль не впорався з якимось типом задач — переносьте цей тип на Opus. Не всю роботу, а конкретний клас задач.

Haiku 4.5: масовка

- витяг структурованих даних
- commit-меседжі
- стаби для тестів
- прості пошукові операції всередині проєкту
- механічна генерація компонентів за готовою специфікацією

Haiku приблизно в 15 разів дешевший за Opus. На задачах «знайди файл, прочитай, віддай» різниці у якості ви не помітите.

Де Haiku підводить: генерує код, який виглядає правильно, але має логічні помилки під поверхнею. Погано тримає складні вимоги й задачі, де треба тримати в голові багато файлів. Тобто для UI за чіткою специфікацією — можна, для UI «зроби гарно» — ні.

Fable 5: козирна карта

Найпотужніша, але непрактична для щоденного. Жере токени як не в себе — користувачі підписки Max повідомляють, що одна активна сесія з'їдає 10-20% денного ліміту. Плюс у підписках доступ до неї то з'являється, то переходить на кредити.

Беріть, коли задача довга, автономна і ціна провалу висока: велика міграція, нічний агент, генерація фронтенду зі скриншота. І давайте їй одразу повне ТЗ — це асинхронний виконавець, а не співрозмовник.

Три речі, які зекономлять вам гроші

Перше. У Claude Code є режим opusplan: Opus думає й будує план, потім автоматично перемикається на Sonnet для написання коду. Отримуєте архітектуру рівня Opus за ціну виконання Sonnet.

Друге. Якщо користуєтесь субагентами — явно прописуйте їм дешеву модель. Багато хто цього не робить, і субагенти успадковують дорогу модель за замовчуванням. Окремо перевірте, чи не стоїть у вас змінна оточення CLAUDE_CODE_SUBAGENT_MODEL — вона перекриває всі налаштування маршрутизації і тихо ганяє все на дорогій моделі.

Третє. Чистіть контекст. Команди /compact і /clear між задачами ріжуть повторне пересилання історії на 30-50%. Постійні речі про проєкт тримайте у файлі CLAUDE.md — вони кешуються зі знижкою.

Що змінилося в Opus 5, і що може зламатись

Якщо ви працюєте через API або будуєте автоматизацію — три моменти:

Режим «думання» тепер увімкнений за замовчуванням. Раніше треба було вмикати вручну. Наслідок: перевірте свій параметр max_tokens, бо токени мислення тепер входять до нього.

Вимкнути думання можна тільки на низьких рівнях зусиль. Якщо поставите високий рівень і спробуєте вимкнути — отримаєте помилку 400.

Приберіть зі своїх промптів інструкції на кшталт «в кінці обов'язково перевір роботу» або «використай окремого агента для перевірки». Opus 5 перевіряє себе сам і від таких інструкцій починає перевіряти надмірно, спалюючи токени намарно.

І ще одне, концептуальне. У Opus 5 і Sonnet 5 є параметр effort — рівень зусиль від низького до максимального. Anthropic прямо радить: спочатку крутіть його, і тільки потім думайте про зміну моделі. Sonnet на високому effort часто закриває задачу, під яку ви вже потягнулись до Opus.

Про дизайн і презентації окремо

Дві тверезі речі, які варто знати заздалегідь.

Перша: без додаткових налаштувань будь-яка модель Claude генерує однаковий візуал — шрифт Inter, фіолетові градієнти, безпечна сітка. Це не проблема моделі, це середнє по датасету. Лікується плагіном frontend-design і власними правилами стилю у CLAUDE.md. Без цього навіть Opus 5 видасть шаблон.

Друга: презентації Claude робить нативними pptx, які реально редагуються. Але очікування має бути таким — приблизно 85% готовності і кілька годин ручного доведення на серйозний дек. Це сильно прискорює роботу, але не замінює її.


Підсумок

Sonnet за замовчуванням. Opus точково там, де він реально потрібен. Haiku на все дешеве й масове. Fable рідко і свідомо.

І найголовніше: не вірте бенчмаркам, вірте своїм задачам. Візьміть п'ять типових завдань зі свого проєкту, прогоніть через різні моделі й подивіться, де реально є різниця. У більшості випадків вона менша, ніж обіцяють лідерборди.
  • 👍 18
  • 🔥 7
  • ❤ 4
Post #1482 1.03K
Понеділок прийшов, а кава пішла. Зранку в мене трагедія — закінчилась кава. І це в понеділок 🤪

Але ви майте смачну каву і хорошого початку тижня, колеги!

ПиСи: сьогодні буде дуже корисний для вас матеріал тут в телеграмі.
  • 😁 12
  • ❤ 1
Post #1481 969
Ганяю Opus 5 в рамках роботи через свій SDLC макретплейс і плагіни там.
В порівнянні з Opus 4.8 скачок якості міркування та уваги до дрібниць і деталей дуже сильно помітно. Поки що я прямо офігіти як задоволений якістю за ті ж гроші.

А який досвід у вас? Встигли трохи спробувати?
GitHub GitHub - AratKruglik/claude-sdlc: Claude Code SDLC marketplace and plugins for different tech stacks Claude Code SDLC marketplace and plugins for different tech stacks - AratKruglik/claude-sdlc
  • 🤯 5
  • ❤ 2
Post #1480 1.06K
Поліз я з цікавості не в бенчмарки релізу Opus 5, а в технічну документацію. Цікавого досить багато.

Anthropic пише прямо: приберіть інструкції на кшталт «в кінці перевір результат» або «віддай перевірку окремому агенту». Модель тепер робить це самостійно, і від дублювання починає перевіряти надмірно. Ваш старий промпт, який раніше підвищував якість, тепер просто спалює токени.

Друга зміна тихіша, але зачепить більше людей. Режим міркування увімкнений за замовчуванням — раніше його треба було задавати вручну. Практичний наслідок: токени мислення тепер входять у ваш max_tokens. Якщо ліміт стоїть щільно, відповіді почнуть обриватись там, де раніше все вміщалось. Плюс на рівнях xhigh і max вимкнути мислення вже не можна, отримаєте помилку 400.

Звідси загальне правило нової версії: спершу крутіть effort, і лише потім думайте про зміну моделі. Sonnet на високому рівні зусиль часто закриває задачу, під яку ви вже потягнулись до Opus.
  • 👍 17
Post #1479 973
Підтверджую
  • 😁 26
  • ❤ 1
Post #1477 1.04K
Реліз, який я чекав вчора. Дуже гучні заяви і цифри, які варто ретельно перевірити.

Anthropic випустила Claude Opus 5

Anthropic представила Claude Opus 5 — модель, яка змінює логіку вибору між тірами. Основна теза анонсу: інтелект, близький до флагманського Fable 5, за половину вартості.

Ціна і доступ
5 доларів за млн вхідних токенів і 25 доларів за млн вихідних — так само, як в Opus 4.8. Тобто приріст якості не коштує нічого додатково. Доступна на всіх платформах, ідентифікатор в API — claude-opus-5. Є Fast mode зі швидкістю приблизно у 2.5 раза вищою за подвійну ціну. Модель стала дефолтною на Claude Max і найсильнішою на Claude Pro.

Що важливо для агентних систем
Два оновлення в беті мають більше практичного значення, ніж бенчмарки. Перше — зміна доступного набору інструментів усередині розмови без інвалідації prompt cache. Для мультиагентних пайплайнів зі змінним скоупом MCP це прямо впливає на вартість. Друге — автоматичні fallback-и на API: запит, позначений класифікатором безпеки, тепер маршрутизується на іншу модель, а не блокується.

Окремо наголошується на самоверифікації. У прикладах Anthropic модель, не маючи доступу до перегляду креслення, написала власний computer vision пайплайн, а за відсутності живого потоку даних побудувала власний тестовий харнес для валідації коду.

Безпека і обмеження
Opus 5 названо найбільш вирівняною моделлю компанії на сьогодні: 2.3 бала за загальною некоректною поведінкою в автоматизованому поведінковому аудиті, найнижчий рівень оманливої поведінки.

Цікавіша деталь у кібербезпеці. Модель майже наздогнала Mythos 5 у пошуку вразливостей, але суттєво відстає в розробці експлойтів для них. Це навмисна асиметрія: класифікатори дозволяють аналіз вихідного коду, але блокують бінарне сканування, пентест і генерацію експлойтів. За оцінкою Anthropic, спрацьовують вони приблизно на 85% рідше, ніж у Fable 5. Заблоковані запити за замовчуванням падають на Opus 4.8.

Підсумок
Opus 5 позиціонується не як найрозумніша модель на ринку, а як найвигідніша за співвідношенням результату до вартості. Для щоденної розробки та довгих агентних сценаріїв це, ймовірно, важливіше за кілька відсотків на топових бенчмарках.

Звучить ну дуже багатообіцяючи, тим більше доганяти конкурентів точно треба.

Що я б перевіряв сам: все реальну поведінку effort-рівнів на довгих пайплайнах і те, чи справді зберігається prompt cache при зміні MCP-скоупу мідсешн. Це два місця, де маркетинговий графік і продакшн зазвичай розходяться.
  • 🔥 12
  • ❤ 5
Post #1476 1.03K
Я тепер PM у Claude
  • 🤣 37
Post #1475 1.04K
Як ви зрозуміли вже, цього тижня стріма не буде. Маю багато всього, що потребує пріорітетного закриття.

Тому писати код руками продовжимо наступного тижня. Якщо вам це цікаво, звісно... бо минулий стрім щось ну жуже кисло по переглядах.
  • ❤ 13
  • 😁 9
Post #1474 1.05K
Доречі!
Будьте людьми — не деплойте сьогодні!
  • 😈 7
  • 🤝 4
  • 👀 1
Post #1473 1.08K
Anthropic випустили Record a Skill

У Claude Desktop у режимі Cowork з’явилась нова функція — Record a Skill. Вона дозволяє навчити Claude повторюваної задачі просто через демонстрацію, без написання інструкцій вручну.

Принцип роботи
Раніше створення власного скіла для Claude означало написання файлу SKILL.md з описом кроків і логіки. Тепер достатньо один раз показати процес: користувач записує екран, виконує задачу і вголос коментує свої дії — які рішення приймає, на які винятки зважає, чому робить саме так. Claude аналізує запис і перетворює його на структурований скіл, який зберігається в бібліотеці і може бути запущений повторно.

Як увімкнути
Функція доступна через меню “+” у чаті Cowork — пункт Record a skill. Після запису потрібних дій і зупинки запису Claude автоматично формує скіл. Розробники рекомендують перевірити готовий скіл на іншому прикладі, а не на тому самому файлі, який використовувався під час запису: демонстрація показує лише один випадок, а скіл має узагальнювати логіку, а не відтворювати випадкові деталі конкретного запису.

Обмеження
Функція доступна лише на платних тарифах — Pro, Max і Team, на безкоштовному тарифі відсутня. Працює тільки в десктоп-версії додатка, у веб- і мобільній версіях Cowork її поки немає. Anthropic окремо звертає увагу, що під час запису не варто озвучувати чутливі дані — паролі, ключі доступу, номери карток.

Де застосовувати
Найбільш придатні сценарії — регулярні, передбачувані процеси: щотижневі звіти, обробка файлів з фіксованою структурою, типовий data entry.

Особисто мені виглядає як прикольний спосіб описати і показати свою щоденну рутину (наприклад збір звіту по всіх слак каналах, робочій пошті). Але, як завжди, треба пробувати спочатку.
  • 👍 9
  • ❤ 2
  • 🔥 1
Post #1472 884
А прикинь одного дня ти прокинешся, а там…
  • 😁 19
  • ❤ 3
  • 😱 3
  • 💯 1
Post #1471 847
KRUHLYK 🇺🇦 І, власне, бенчмарки. З цікавого вона дешевша за 3.5 Flash на аутпуті. Це добре.
Коротше, що можу сказати. Процент жирів в маслі підріс помітно і це добре. Але це бенчмарки.
В реальних задачах Flash модель типу швидше працює і наче по даним тих самих бенчмарків краще за Про модель. Я повірю тут, окрім одного.

Flash модель не вміє так глибоко аналізувати весь контекст як це робить Pro лінійка як не крути. Вона виконає круто те, що ви їх в спеках скажете. Але зробити глибокий і якісний аналіз вона ніхріна не може на стільки краще.

От тому я і чекаю на Gemini 3.5 Pro щоб подивитись що вона зможе в порівнянні з 3.1 Pro.
  • 👍 7
  • 🥴 1
Post #1470 903
KRUHLYK 🇺🇦 А тим часом Google якось по-тихому викотила Gemini 3.6 Flash, яка вже доступна скрізь, в Antigravity зокрема. Я все ще очікую Gemini 3.5 Pro, де за чутками обіцять чи не рівень моделей Sol від OpenAI 🤪
І, власне, бенчмарки. З цікавого вона дешевша за 3.5 Flash на аутпуті. Це добре.
  • 👍 4
  • 🥴 2
Post #1469 976
А тим часом Google якось по-тихому викотила Gemini 3.6 Flash, яка вже доступна скрізь, в Antigravity зокрема.

Я все ще очікую Gemini 3.5 Pro, де за чутками обіцять чи не рівень моделей Sol від OpenAI 🤪
  • 😁 3
  • 🥴 2
  • 👍 1
Post #1467 973
Наче в четвер Антропіки мають викотити Opus 5. Ну правильно конкурентів (OpenAI) треба наздоганяти. Цікаво на скільки процент жирів у маслі збільшать.
Якихось особливих очікувань у мене вже давно немає. Рівня поточних моделей для коду вистачає за очі.
Для різних графічних чи дизайнерських задач можливо можна ще краще.

Що думаєте?
  • ❤ 2
  • 👍 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →