TGViewer
Channel Public Channel
very vibe coding

very vibe coding

@veryvibecoding

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Subscribers
120
Photos
463
Videos
126
Links
991

Showing posts older than #1027 · Back to latest

Older Posts 13 shown
Post #1026 41
Post #1020 34

Forwarded from Machinelearning

👀 Релиз SAM 3.1 - одной из самых сильных open-source моделей для компьютерного зрения.

Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.

Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.

Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.

Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.

Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.

В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.

По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.

Теперь модель может отслеживать до 16 объектов за один проход.

С multiplexing все объекты обрабатываются одновременно:

• меньше лишних вычислений
• нет узких мест по памяти

Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!

На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.

https://github.com/facebookresearch/sam3

@ai_machinelearning_big_data

#ai #ml #llm #cv #python
Post #1019 29
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….
Post #1017 24

Forwarded from Анализ данных (Data analysis)

📌 Большой мастер-класс по Claude Code!

Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.

Что внутри:

• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов

• Большая библиотека кастомных команд под реальные задачи

• Готовые шаблоны памяти - как для одиночной работы, так и для команд

• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации

• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия

• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам

• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает

• Примеры настройки узкоспециализированных субагентов

• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы

https://github.com/luongnv89/claude-howto
  • 🔥 1
Post #1014 31

Forwarded from Data Secrets

Google выпустили Gemini 3.1 Flash Live

Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.

Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).

Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.

По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.

Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.

Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Post #1013 30
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.

Что важно:

• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.

Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.

Ссылки:

• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
huggingface.co mistralai/Voxtral-Mini-4B-Realtime-2602 · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Post #1011 27
Codex запустил плагины в своем приложении типа @gmail @figma, и обнулил лимиты, чтобы можно было их как следует потестировать. Праздник продолжается
X (formerly Twitter) OpenAI Developers (@OpenAIDevs) on X We're rolling out plugins in Codex. Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more. https://t.co/PQDsLqHGA6
Post #1010 32
А нового DeepSeek все нет, и нет…
Post #1009 33
MaestroUndenis
Вышла новая Suno 5.5, посвящаю этот трек Маэстро 🐱🐱
Post #1008 35
Хотите запустить Qwen 35B на мак мини? С 16гб? Тогда вам сюда. Обещают 30 токенов в секунду. Правда, на контекст мало памяти останется
GitHub GitHub - walter-grace/mac-code: mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple… mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple Silicon flash-paging. $0/month. - walter-grace/mac-code
Post #1007 34
Вожусь с графами, чтобы модель лучше ПОНИМАЛА смысл текста. И, судя по всему, проблема (помимо методических) в том, что для создания по тексту графа нельзя использовать дешевые модели, как в RAG. Надо - дорогую, и, возможно, САМУЮ дорогую. Впрочем, стоит ли удивляться - ведь задача-то сложная..
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →