TGViewer
Channel Public Channel
very vibe coding

very vibe coding

@veryvibecoding

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Subscribers
117
Photos
460
Videos
126
Links
976

Showing posts older than #1480 · Back to latest

Older Posts 20 shown
Post #1479 47
Я тут как раз пытался пересадить скрипт по подготовки презентаций с Клода на DeepSeek, да еще и его харнесс. Но было не особо, так как писать презентации он мог, а видеть - нет. Как Бетховен.

Так что, то, что у Дипсика появилось зрение - очень даже кстати.

https://t.me/dealerAI/1903
Telegram Dealer.AI DeepSeek выпустил мультимодальную модель для агентов. 🪨 Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность…
Post #1478 62
Qwen3.8 стал хитом, и под него тут же появилась нецензурированная версия, о ней много кто писал, но есть и другие интересные варианты - например, ускоренная модель, которая выдает а пару раз больше токенов..
inco.ai DFlash 2: Keep Drafting Parallel DFlash 2 is the successor to our widely deployed parallel drafter: close to 3× the speed of autoregressive decoding, with the same output. Drafters for Qwen3.8-27B and Meta's Muse Glimmer are out today.
Post #1477 57
Post #1476 49

Forwarded from Tips AI | IT & AI

Если вы часто отлаживаете UI-анимации, и ловите проблему когда OCR клода не может понять что именно не так

Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:

1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом

В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
- Агент и человек работает в одной и той же среде: агент управляет через команды а человек видит это в реальном времени
- Внутри полноценный Chromium, а не кастрированный текстовый браузер


Установить: terminal-browser.com

Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)

@tips_ai #tools
Post #1475 42
Здесь только маленькая проблема - все цифры идут от автора скилла. А так, любопытно, конечно
Post #1474 50

Forwarded from Machine learning Interview

🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели

К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.

По опубликованным результатам прирост местами очень серьёзный:

* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5

В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.

https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
Post #1473 44

Forwarded from Denis Sexy IT 🤖

Кино-адаптация побега роботов с серверов OpenAI
Post #1472 49
Только стоило написать про Claude code и дизайн, как появился официальный скилл по дизайну от Антропика
Post #1471 46
Post #1470 48
Интересная история - Антропик выпустил приложение Дизайн для рисования презентаций, я вроде как его освоил, но по привычке продолжал работать с Клод-кодом. И там тоже стали выходить нормальные презентации - я думал поначалу, что это дизайн был подключен, но нет, это разные продукты.

Суть в том, что дизайн рисует в html - и дальше либо вы используете pdf либо будет не самый простой перевод в паверпойнт. А клод-код кодирует презентацию на питоне сразу в паверпойнте. Поэтому если надо быстрее, красивее и пдф - норм, берите дизайн. Или если надо какую-то новую сложную мульку нарисовать. Если надо редактируемую презентацию - идите срузу в код.

Сделайте свой скилл для презентаций. Дайте примеры. Будете экономить время на ошибках. Потребует, конечно, какого-то времени - у меня сейчас кода 5 тыс. строк, но оно стоит того.
Post #1469 48
Post #1468 46

Forwarded from Machine learning Interview

🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы.

Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:

• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling

Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.

sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.

MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.

Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.

А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.

То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.

https://github.com/deepseek-ai/deepseek-harness
Post #1467 50
В течение двух часов выйдет Qwen 3.8 27B - лучшая модель, которую можно запустить на базовом Mac Studio или мощной прошке. Это я авансом, но сильно сомневаться не приходится, конкурентов не сказать, чтобы было много..
Post #1466 56
Google банит пользователей из России по информации об их эккаунте, поэтому и впн не помогает. Можно, конечно, новые эккаунты создавать, но оно надо? Лично я для себя тоже Google забанил, с начала лета. Нисколечко не страдаю..

https://t.me/data_analysis_ml/5600
Telegram Анализ данных (Data analysis) 🚨 Gemini перестала открываться у части пользователей из России даже через VPN. Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей. Пользователи сообщают, что доступ к чат-боту не восстанавливается…
Post #1465 50
GLM-5.3 вышла. Не только лучше 5.2, но и лучше Kimi K3. Потестим
Post #1464 58
Смешно. Кому нужна Google 3.7 Flash, которая стоит больше DeepSeek V4 Pro, и кто о ней вообще вспомнит через полгода…

Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла

https://t.me/ai_machinelearning_big_data/10703
Telegram Machinelearning ⚡️ Google выпустила Gemini 3.7 Flash Через три недели после 3.6 Flash Google обновила рабочую модель линейки - ту, на которую разработчики вешают основную нагрузку. Вводная цена вдвое ниже прежней - 0,75 доллара за миллион входных токенов и 3,75 за миллион…
Post #1463 39
Post #1462 51
Немного про свой опыт. В последнее время использую 4 модели: Claude (200$), ChatGPT (100$), GLM-5.2 (60$), DeepSeek (API). Впечатления такие.

Все запускаю через Claude code Desctop - вернулся к стандартному решению от Антропика. У OpenAI, по сути, все то же самое, но к Клоду привык больше, и в нем я могу запустить все модели как субагентов.

Что получается хорошо - презентации. На удивление удалось решить проблему, которая казалась наиболее тяжелой. Сделал стандартный скилл, кидаю модели справку, она делает презентацию - качество хорошее, смысл перекладывает в картинки тоже нормально. Обычно делаю с помощью Опус (Соннет и Хайку не использую никогда, большой разницы между Fable и Opus просто не вижу).

Высокие уровни размышления едят токены и работают медленно - часто удобно их снизить.

Программирует, в основном, ChatGPT - Sol, Terra. В последнее время лимиты стали уходить быстро - недельный лимит высаживаю за день легко. Переложить все на GLM не получается - на длинных агентских задачах ломается. Использую ее и DeepSeek как ревьеров - ищут ошибки и проблемы нормально. При этом подписка за GLM самая переоцененная, готов от нее отказаться. А DeepSeek по апи тратит деньги очень экономно - возможно, буду использовать его более активно. Особенно там, где надо не программировать, а много работать моделью.

Потихоньку расширяю рабочие сценарии использования моделей, буду пробовать новые варианты
Post #1461 38

Forwarded from Анализ данных (Data analysis)

🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу

В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.

Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.

Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.

Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.

По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.

Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:

Model + Harness + Tools + Cache + Multi-Agent

И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.

#DeepSeek #AI #Agents #CodingAgents #LLM
Post #1460 37
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →