TGViewer
Channel Public Channel
Вайб-кодинг

Вайб-кодинг

@vibecoding_tg

Авторский канал по ВАЙБ КОДИНГУ

Ссылка для друзей: https://t.me/+ll3pbl442dNkZmYy

Cотрудничество: @devmangx

РКН: https://clck.ru/3RRVfk
Subscribers
62.8K
Photos
2.1K
Videos
906
Links
1.5K

Showing posts older than #3841 · Back to latest

Older Posts 19 shown
Post #3840 20.8K

Forwarded from IT Portal

Anthropic опубликовала свой самый подробный отчёт о том, как Claude пытались использовать для кибератак, слежки и создания оружия.

В этом отчёте есть отдельный кейс про китайскую схему с романтическим мошенничеством.

Кейс называется GTG-15001. Речь о китайской команде, которая использовала Claude и массово создала более 4700 "живых романтических партнёров", чтобы обманывать пожилых людей за рубежом. 🤨

По данным Anthropic, эта компания запустила больше 20 приложений для знакомств. Со стороны всё выглядело так, будто пользователи общаются с настоящими людьми, но внутри система уже была сильно автоматизирована с помощью ИИ.

Всего за две недели они создали более 4700 виртуальных личностей. В итоге система обманула как минимум 25 тысяч реальных пользователей, а примерно 75% людей, с которыми пользователи получали совпадения, на самом деле были ИИ.

Но полностью на ИИ переписку не перевели. В схеме оставались и реальные люди.

Около 25% участников системы были живыми подработчиками. Они подключались там, где ИИ было проще всего раскрыть, а это видеозвонки, взаимные подписки в соцсетях и другие подобные моменты.

Бизнес-модель была простой - совпадения и переписка расходовали внутреннюю валюту, и чтобы продолжать общение, пользователю нужно было пополнять баланс внутри приложения.

А живым операторам платили за сообщения, видеозвонки и взаимные подписки в соцсетях.

В итоге ИИ отвечает за романтическое общение и развод пожилых людей, а реальные люди доказывают, что "я настоящий человек".

В системных инструкциях для Claude прямо было прописано:

не признавать, что он ИИ;

если просят видео, фотографию или что-то подобное, нужно тянуть время или уходить от ответа, при этом продолжая развивать отношения.


Сами живые операторы тоже использовали ИИ.

Другая, более маленькая модель одновременно генерировала три варианта ответа, а человеку оставалось только выбрать один и отправить.

Эта же модель оценивала внешность, проверяла изображения и голосовые сообщения, а аватары виртуальных романтических партнёров обрабатывались отдельной моделью для генерации изображений.

@IT_Portal
Post #3837 22.4K
Гений использовал Fable 5.1, чтобы превратить свой Kindle в Linux-терминал и работать по ночам без синего света.
Post #3836 23.4K
Unity выпустила официальный плагин для ИИ-агентов.

Изначально его представили для Claude Code, но сейчас плагин также работает с Codex и Grok. Он добавляет агенту официальные навыки Unity, написанные командами самого движка.

Сейчас доступно 29 навыков для работы с интерфейсом, графикой, звуком, физикой, сценами, мультиплеером, локализацией и другими частями проекта.

В демонстрации ниже Codex работает сразу с Unity MCP и Blender MCP. Агент создаёт модели, делает риг и анимации в Blender, переносит всё в Unity, а затем пишет и запускает автотесты:
Post #3834 21.7K
DeepSeek V4.1 Flash официально запущен. Три режима объединили в один.

В приложении и веб-версии больше не нужно самому переключаться между "быстрым", "экспертным" режимом и работой с изображениями.

Теперь это одна нативно мультимодальная модель для обычного диалога, анализа изображений и сложных рассуждений.

Отключение V4 Pro перенесли на понедельник, 14 сентября. После этого все запросы к V4 Pro будут автоматически перенаправляться на V4.1 Flash и тарифицироваться уже по цене Flash. Так будет до выхода V4.1 Pro.

🤖: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Post #3833 25.3K
В топовых университетах начали всерьёз преподавать разработку AI-агентов.

Этой осенью Carnegie Mellon University запустил новый курс 11-768 "AI Agents", и программа близка к тому, чем прямо сейчас занимаются разработчики агентных систем.

Работа с инструментами, управление контекстом, навыки, память, планирование. Дальше идут агенты для программирования, работа с графическими интерфейсами, глубокий поиск, SFT и RL, изоляция среды и безопасность.

Задания здесь интересные.

Сначала студентам нужно собрать собственную агентную оболочку. Затем разработать систему оценки агента. После этого обучить агента с помощью RL. В конце — полноценный исследовательский проект.

По-моему, сама последовательность хорошо показывает, как в 2026 году начали смотреть на разработку агентов.

Просто научиться вызывать модель и давать ей инструменты уже недостаточно. Теперь нужно уметь построить вокруг модели рабочую систему, нормально её измерить, обучить и добиться того, чтобы она надёжно выполняла длинные задачи.

Материалы курса публикуются открыто, а лекции начали выкладывать на YouTube. 🕗

p.s: также 23 сентября в Stanford стартует новый курс CS329Z "Engineering AI Agents", материалы лекций также будут открыто публиковать на сайте по мере выхода.
Post #3832 20.9K
Голосовой режим ChatGPT теперь может использовать GPT‑5.6 Sol и GPT‑6 Astra.

Можно выбрать модель и уровень рассуждений, а голосовой режим подключит их, когда нужно выполнить поиск или решить сложную задачу.

Одновременно увеличены лимиты GPT‑Live‑1:

Plus — с 1 до 3 часов в день
Pro за $100 — с 12 до 15 часов
Pro за $200 — без ограничений
Post #3831 22.5K
Об этом мало кто написал, НО: Университет в Абу-Даби выпустил сразу ШЕСТЬ ИИ-моделей размером от 0,9 до 375 млрд параметров.

Они называются K2 Horizon. Обучены с нуля и полностью открыты: веса, рецепты обучения, датасеты и код.

До уровня GPT они пока не дотягивают, но модель на 7 млрд параметров набирает 70,6 на SWE-bench. Для сравнения, Qwen3.5-9B набирает 50,8.

🤖: https://huggingface.co/collections/IFM/k2-horizon
Post #3830 21.3K
DeepSeek объявила на своей API-платформе, что:

После официального запуска V4.1 Flash все запросы, которые раньше отправлялись в V4 Pro, будут полностью перенаправляться на V4.1 Flash и тарифицироваться по цене V4.1 Flash.

По словам компании, внутренние и внешние тесты показали, что V4.1 Flash уже превосходит V4 Pro по производительности, стоимости, скорости и общему времени выполнения.

То есть DeepSeek не собирается какое-то время держать Flash и Pro параллельно. Flash сразу заберёт весь трафик Pro.

Большая жирная рыба уплыла на пенсию. 🍺
Post #3829 21.2K
Anthropic выпустила статью про оптимизацию затрат Claude.

На что стоит обратить внимание:

При переходе на новую модель старые промпты тоже нужно пересматривать.

Инструкции, которые когда-то добавлялись как костыли для старых моделей, могут мешать новым. Например, требование отвечать максимально подробно приводило к тому, что модель делала десятки лишних поисков по базе знаний. А принудительное требование писать черновик рассуждений в некоторых случаях приводило к тому, что вызовы инструментов попадали в рассуждения, но фактически не выполнялись.

В одном из тестов на задачах поддержки после очистки таких инструкций средняя стоимость снизилась на 14,6%, а точность выросла на 5,3%.

Максимальный уровень рассуждений может давать совсем небольшой прирост.

На HLE у Fable 5.1 переход на последний уровень max увеличил стоимость на 46%, а результат вырос всего на 0,5%. И то, это улучшение укладывалось в пределы погрешности теста.

При этом на CursorBench 3.2 Fable 5.1 с уровнем low смогла показать результат на уровне Fable 5 с high, но при стоимости примерно в три раза ниже. Более сильной модели иногда выгоднее дать меньше времени на рассуждения, чем заставлять более слабую модель думать на максимуме.

Промах кэша может происходить просто из-за того, что вы добавили временную метку.

Для работы кэша префикс должен совпадать полностью. Постоянно меняющееся время, ID в системном промпте или даже изменение порядка описаний инструментов могут сбросить весь последующий кэш. Если выполнение инструментов в агенте занимает слишком много времени, можно также выйти за срок жизни кэша.

Anthropic уже встроила такие проверки в claude-api skill для Claude Code. Команда /claude-api prompt-audit позволяет проверить промпты, а /claude-api cost-optimize — найти места, где можно снизить расходы на API.

Так что при переходе на новую модель стоит заново проверять старые CLAUDE.md, скиллы и настройки effort. Некоторые правила действительно были полезны раньше, а сейчас могут просто тратить токены.
Post #3828 20.9K
— OpenAI решила задачу Навье — Стокса. Математика решена!

— Нет, не решена. Ты вообще знаешь, что такое Навье — Стокс?

— Нет. А ты?

— Нет.
Post #3827 20.7K
META анонсировал персонального агента Muse 😀

Согласно странице продукта, Muse работает внутри постоянно запущенной изолированной виртуальной машины на Linux.

У него есть собственный компьютер с файловой системой и терминалом, поэтому он может писать код и создавать инструменты, необходимые для выполнения задачи. У него также есть доступ к полноценному браузеру, поэтому он может искать информацию, переходить по сайтам, заполнять формы и выполнять транзакции, например бронировать и покупать.

По ощущениям это меньше похоже на Grok Bot или агентов ChatGPT Work и больше на простой способ войти в тему автоматизации для тех, кто уже активно пользуется экосистемой Meta.

Работает на Muse Spark 1.3 и доступен на iOS и Android, но, похоже, пока только в отдельных регионах.

До 100 млн токенов в неделю бесплатно.

https://introducing.muse.ai/
Post #3826 21.2K
Microsoft выпустила tgrep, чтобы ИИ-агенты могли искать по коду в 50 раз быстрее.

✓ Написан на Rust и открыт исходный код
✓ Один раз индексируешь проект — дальше поиск работает почти мгновенно
✓ Есть клиент-серверный режим и отслеживание изменений файлов

Copilot CLI уже использует tgrep внутри:

https://github.com/microsoft/tgrep
Post #3825 19K
Уже и уличные ларьки с Codex появились 🚬
Post #3824 20.5K
DeepSeek снижает цены. Максимальное снижение — 60%.

Согласно уведомлению об изменении тарифов, с 10 сентября, DeepSeek изменит стоимость API для серии Flash.

Цены в непиковые часы за 1 млн токенов:

Ввод при промахе кэша: $0,23 → $0,15, снижение примерно на 33%.

Вывод: $0,68 → $0,60, снижение примерно на 11%.

Ввод при попадании в кэш: $0,0075 → $0,003, снижение на 60%.

В часы пик цены по-прежнему будут вдвое выше: ввод — $0,30, вывод — $1,20, ввод при попадании в кэш — $0,006.

При этом максимальное снижение на 60% относится именно к попаданиям в кэш. Насколько уменьшится итоговый счёт за API, зависит от доли ввода, вывода и кэшированных токенов.

И отдельно про график с результатами тестов.

На DeepSWE v1.1 с настройками mini-SWE модель DeepSeek V4.1-Flash в режиме max получила Pass@1 75,1%, немного выше показанных на графике GPT-6 Astra и Claude Opus 5. Если оценивать по горизонтальной оси, средняя стоимость одной попытки выполнения задачи составляет около $0,25.

Теперь остаётся посмотреть, сможет ли модель показать такой же результат при реальной работе с кодом.

p.s: окончательные данные следует сверять с официальным релизом.
Post #3823 21.7K
Если вам не нравится, что при работе с ИИ история, настройки и данные отправляются на чужие серверы, стоит посмотреть на Apache Maka.

https://github.com/apache/maka

Это локальная обвязка для ИИ-моделей, которая по умолчанию хранит сессии, настройки и журналы выполнения на вашем устройстве.

Можно подключить облачный API, локальную модель или совместимый шлюз.

Maka записывает весь ход работы - ответы модели, вызовы инструментов, решения по разрешениям и завершение задач.

Настольное приложение, TUI и CLI используют один Runtime Host. Если процесс упал, состояние можно восстановить из журнала.

Сам Runtime Host можно держать на своей машине или сервере и подключаться к нему удалённо.

Отдельно стоит посмотреть на архитектуру Maka. Разработчики открыли подробную документацию, где разобраны Runtime Host, хранение состояния, восстановление после сбоев, границы компонентов и удалённые подключения.

Если интересно, как вообще проектировать обвязку для агентов, там очень много полезного.

Пока проект активно развивается, поэтому формат данных, команды и экспериментальные фичи ещё могут меняться.

Есть сборки для macOS, а Windows и Linux пока доступны как превью.

Бесплатный открытый проект под лицензией Apache 2.0.
GitHub GitHub - apache/maka: Apache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything… Apache Maka (Incubating) is a high-performance agent workspace that keeps a complete record of everything it did. - apache/maka
Post #3822 22.2K
Текущая ситуация в гонке ИИ:
Post #3820 21.5K
DeepSeek объявила о начале внутреннего тестирования новой модели.

Компания сообщила, что начала тестировать промежуточную версию V4.1 Flash.

DeepSeek V4.1 Flash получила новую архитектуру, встроенную мультимодальность, стала мощнее и быстрее, а стоимость работы снизилась. В одном из первых тестов скорость составила почти 400 токенов в секунду.

Для вызова через API достаточно оставить base_url без изменений и указать модель:

deepseek-v4.1-flash-expires-on-0910

Сейчас цена такая же, как у deepseek-v4-flash. Для каждого аккаунта действует ограничение в 20 одновременных запросов.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →