Post #1026
41
Channel Public Channel
VE very vibe coding
@veryvibecoding
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
- Subscribers
- 120
- Photos
- 463
- Videos
- 126
- Links
- 991
Showing posts older than #1027 · Back to latest
Older Posts 13 shown
Post #1020
34
Forwarded from Machinelearning




👀 Релиз SAM 3.1 - одной из самых сильных open-source моделей для компьютерного зрения.
Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.
Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.
Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.
Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.
Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.
В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.
По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.
Теперь модель может отслеживать до 16 объектов за один проход.
С multiplexing все объекты обрабатываются одновременно:
• меньше лишних вычислений
• нет узких мест по памяти
Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!
На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.
https://github.com/facebookresearch/sam3
@ai_machinelearning_big_data
#ai #ml #llm #cv #python
Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.
Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.
Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.
Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.
Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.
В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.
По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.
Теперь модель может отслеживать до 16 объектов за один проход.
С multiplexing все объекты обрабатываются одновременно:
• меньше лишних вычислений
• нет узких мест по памяти
Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!
На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.
https://github.com/facebookresearch/sam3
@ai_machinelearning_big_data
#ai #ml #llm #cv #python
Post #1019
29
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….
Post #1018
30
Может быть интересно, если есть задачки для средненькой модели
https://t.me/ai_machinelearning_big_data/9765
https://t.me/ai_machinelearning_big_data/9765
Post #1017
24
Forwarded from Анализ данных (Data analysis)

📌 Большой мастер-класс по Claude Code!
Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.
Что внутри:
• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов
• Большая библиотека кастомных команд под реальные задачи
• Готовые шаблоны памяти - как для одиночной работы, так и для команд
• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации
• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия
• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам
• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает
• Примеры настройки узкоспециализированных субагентов
• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы
https://github.com/luongnv89/claude-howto
Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.
Что внутри:
• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов
• Большая библиотека кастомных команд под реальные задачи
• Готовые шаблоны памяти - как для одиночной работы, так и для команд
• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации
• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия
• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам
• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает
• Примеры настройки узкоспециализированных субагентов
• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы
https://github.com/luongnv89/claude-howto
- 🔥 1
Post #1014
31
Forwarded from Data Secrets



Google выпустили Gemini 3.1 Flash Live
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Post #1013
30
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Post #1012
28
Ну а Claude code запустил auto fix команду для автоматического исправления ошибок..
X (formerly Twitter) Noah Zweben (@noahzweben) on X Thrilled to announce Claude Code auto-fix – in the cloud. Web/Mobile sessions can now automatically follow PRs - fixing CI failures and addressing comments so that your PR is always green.
This happens remotely so you can fully walk away and come back to… Post #1011
27
Codex запустил плагины в своем приложении типа @gmail @figma, и обнулил лимиты, чтобы можно было их как следует потестировать. Праздник продолжается
X (formerly Twitter) OpenAI Developers (@OpenAIDevs) on X We're rolling out plugins in Codex.
Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more.
https://t.co/PQDsLqHGA6 Post #1010
32
А нового DeepSeek все нет, и нет…
Post #1009
33
MaestroUndenis
Вышла новая Suno 5.5, посвящаю этот трек Маэстро 🐱🐱
Post #1008
35
Хотите запустить Qwen 35B на мак мини? С 16гб? Тогда вам сюда. Обещают 30 токенов в секунду. Правда, на контекст мало памяти останется
Post #1007
34
Вожусь с графами, чтобы модель лучше ПОНИМАЛА смысл текста. И, судя по всему, проблема (помимо методических) в том, что для создания по тексту графа нельзя использовать дешевые модели, как в RAG. Надо - дорогую, и, возможно, САМУЮ дорогую. Впрочем, стоит ли удивляться - ведь задача-то сложная..