TGViewer
Channel Public Channel
Tensorflow(@CVision)

Tensorflow(@CVision)

@cvision

اخبار حوزه یادگیری عمیق و هوش مصنوعی
مقالات و یافته های جدید یادگیری عمیق
بینایی ماشین و پردازش تصویر

TensorFlow, Keras, Deep Learning, Computer Vision

سایت:
http://class.vision

👨‍💻👩‍💻پشتیبان دوره ها:
@classvision_support

لینک گروه:
@tf2keras
Subscribers
15.1K
Photos
1.3K
Videos
318
Links
2.6K
Recent Posts 20 shown
Post #4395 1.62K
🚀 کلاس‌ویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته 🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید: 📌 ۱ دوره از سایت کلاس ویژن 🧠 دوره آموزشی ویدیویی Graph Neural Network 📚 3 دوره از کلاس ویژن در مکتب‌خونه 🤖 آموزش Agentic AI با پایتون 🧠 آموزش هوش…
مهلت استفاده تا پایان این هفته است
  • 🔥 2
Post #4394 3.24K
‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟

‏Jev‏ بیشتر از اینکه جای GPT‏ یا Claude‏ را بگیرد، می‌تواند یک «لایه‌ی تصمیم‌گیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بی‌خودی برای هرکدام یک مدل بزرگ صدا می‌زنیم.

‏تقسیم کار پیشنهادی (Separation of Concerns‏):

‏• تصمیم‌های کوچک و پرتعداد ← Jev
‏• تحلیل، reasoning‏ و تولید محتوا ← GPT / Claude / Gemini‏
‏• قوانین قطعی، محاسبات و محدودیت‌های حساس ← Code‏
‏• تصمیم‌های پرریسک ← انسان

‏نمونه کاربردها:

‏• CRM‏: دسته‌بندی مشتری‌ها بر اساس احتمال ریزش، اهمیت یا نوع درخواست
‏• Support‏ و Lead Scoring‏: تشخیص فوریت، تیم مناسب و ارزش سرنخ‌ها
‏• Agent Routing‏: انتخاب agent‏، tool‏ یا مدل مناسب قبل از شروع کار سنگین
‏• RAG‏: حذف اسناد کم‌ربط و re-rank‏ نتایج
‏• QA‏ و Moderation‏: بررسی کیفیت، ارتباط و ریسک خروجی مدل‌ها، و پرچم‌گذاری محتوای مشکوک
‏• Workflow Automation‏: تعیین شاخه‌ی فرایند برای هر درخواست
‏• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه

‏⚠️ اما Jev‏ «خیلی باهوش‌تر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئله‌های مبهم افت می‌کند. دو نمونه:

‏1️⃣ Browser automation‏
‏تیم WebMCP‏ (Idan Levin‏) با ترکیب Jev‏ و WebMCP‏ همه‌ی 49 task‏ را حل کرد. ولی این ترکیب دو مدل بود: Jev‏ ابزار را انتخاب می‌کرد و یک LLM‏ سریع (Mercury 2.5‏) آرگومان‌ها را می‌نوشت، چون Jev‏ متن تولید نمی‌کند. وقتی Jev‏ مستقیم با کنترل‌های صفحه مرورگر را می‌راند، فقط 25 از 49 task‏ حل شد. خود نویسندگان می‌گویند این نتیجه‌ی harness‏ آن‌هاست و سقف عمومی Jev‏ نیست.

‏2️⃣ تشخیص phishing‏
‏در یک benchmark‏ مستقل روی 2000 ایمیل (ایمیل‌های synthetic‏)، دقت مستقیم Jev‏ فقط 62.6٪ بود و Claude Haiku 4.5‏ به 81.3٪ رسید.
‏ولی وقتی همان مسئله به 5 سؤال ساده‌تر شکسته شد (مثلاً: لینک به free hosting‏ اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جواب‌های Jev‏ به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنال‌ها 89.5٪ می‌داد.

‏در همین تست Jev‏ حدود 3 برابر سریع‌تر (239ms‏ در برابر 687ms‏) و حدود 12 برابر ارزان‌تر ($0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku‏ بود. یعنی در مقایسه با یک مدل سبک، ضریب‌ها خیلی کمتر از «40x‏ تا 200x‏» است.

‏پس جای درست Jev‏ «مغز کل سیستم» نیست، بلکه یک قطعه‌ی سریع برای تصمیم‌های محدود داخل یک معماری بزرگ‌تر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهم‌تر، چندمرحله‌ای‌تر یا پرریسک‌تر شود، بهتر است به یک مدل قوی‌تر یا انسان سپرده شود.

‏منابع:
‏https://madewithjev.com/builds/webmcp-benchmark
‏https://github.com/anisselbd/jev-phishing-bench
Madewithjev Jev on the WebMCP benchmark — built with Jev Jev picks the tool, a fast LLM fills the arguments: 49 of 49 tasks solved.
  • ❤ 16
  • 👏 5
Post #4393 2.54K
‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد

‏TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev‏، را در حالت early access‏ (با waitlist‏) عرضه کرد. بنیان‌گذار و CEO آن، Diogo Almeida‏، سابقه‌ی کار در OpenAI‏ دارد و از نویسندگان مقاله‌ی InstructGPT‏ است.

‏ایده جالب است: به‌جای ساختن یک LLM‏ بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیم‌گیری داخل نرم‌افزار طراحی شده.

‏مشکل کجاست؟
‏LLMها برای chat‏ عالی‌اند، ولی در automation‏ هنوز دردسر دارند: خروجی string‏ است و باید parse‏ و validate‏ شود، latency‏ بالاست و confidence‌ای که خودشان می‌دهند همیشه قابل اعتماد نیست.

‏Jev‏ چه می‌کند؟
‏Jev از دسته‌ی جدیدی به اسم System One Models‏ است (نامش از تمایز System 1‏ و System 2‏ دنیل کانمن آمده):

‏• ورودی: متن یا state‏ نامرتب (مثلاً JSON‏) + مجموعه‌ای سؤال تایپ‌شده
‏• خروجی: از قبل type‏ مشخص دارد؛ انتخاب بین گزینه‌ها (`Choice`‏)، امتیاز (`Score`‏) یا بله/خیر با احتمال (`Noul`‏)، همراه با confidence‏
‏• همه‌ی سؤال‌ها در یک query‏ و به‌صورت موازی جواب داده می‌شوند، نه توکن‌به‌توکن مثل LLMهای autoregressive‏

‏آموزش هم با روشی به اسم **RLCD**‏ (Reinforcement Learning for Calibrated Decisions‏) انجام شده. هدفش این است که احتمال‌ها واقعاً معنی داشته باشند: وقتی مدل می‌گوید ۹۰٪ مطمئنم، انتظار می‌رود تقریباً در ۹۰٪ موارد مشابه درست باشد.

‏ادعاهای شرکت:

‏• latency‏ حدود 70 تا 500 میلی‌ثانیه، یعنی 40x‏ تا 200x‏ سریع‌تر از LLMهای frontier‏ در taskهای System One‏
‏• قیمت $0.042 برای هر یک میلیون توکن ورودی؛ خروجی رایگان
‏• «no type errors‏»: چون خروجی از قبل schema‏ دارد، مدل نمی‌تواند مقداری خارج از ساختار تعریف‌شده برگرداند

‏⚠️ «no type errors‏» یعنی خروجی type-safe‏ است، نه اینکه «هیچ‌وقت اشتباه نمی‌کند». تصمیم می‌تواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود شرکت است.

‏منبع:
‏https://typesafe.ai/blog/introducing-system-one-models-and-jev
typesafe.ai Introducing System One Models & Jev - TypeSafe AI Blog TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
  • ❤ 4
  • 👏 3
Post #4391 2.86K

Forwarded from 🚀 کلاس‌ویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته

🍂 به مناسبت شروع ماه مهر
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:

📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network

📚 3 دوره از کلاس ویژن در مکتب‌خونه

🤖 آموزش Agentic AI با پایتون

🧠 آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM)

👁 آموزش مدل‌های زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاین‌تیون پیشرفته

⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
  • ❤ 8
Post #4389 3.27K
دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار داده میشه.

@pythony
  • ❤ 6
Post #4388 2.84K

Forwarded from 🚀 کلاس‌ویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته

🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحله‌به‌مرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدم‌به‌قدم یاد می‌گیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستم‌های چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و می‌خوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف: COUPON-8759A
👇 ثبت‌نام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیت‌هاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
  • ❤ 3
  • 👍 2
Post #4387 3.1K
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟

OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیق‌تر تصاویر عرضه کرده.

مهم‌ترین تغییرات 👇

⚡️ تولید تصویر تا حدود ۲ برابر سریع‌تر
🖼️ حفظ بهتر چهره، محصول و سوژه‌ی تصویر مرجع
✏️ ویرایش‌های چندمرحله‌ای با تغییر کمتر در بخش‌های دیگر تصویر
✨ نور، بافت و پس‌زمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده

در API هم دو نسخه داریم:

Flare
→ سریع‌تر و مناسب استفاده روزمره
Sunburst
→ مناسب خروجی نهایی و ویرایش‌های دقیق‌تر

نکته مهم برای توسعه‌دهنده‌ها:
اگر از API استفاده می‌کنید، مقدار quality را حتماً مشخص کنید؛ چون سطح‌های کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کرده‌اند.

در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀

🌀 @cvision 🌀
  • ❤ 5
  • 👍 2
Post #4386 4.09K
معرفی 🚀 GPT-6 Astra

اوپن‌ای‌آی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و هم‌راستاترین مدل خود تا امروز معرفی می‌کند.
آسترا 🧠 در حوزه‌هایی مثل برنامه‌نویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفه‌ای چندمرحله‌ای پیشرفت قابل‌توجهی داشته است.
یکی از مهم‌ترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل می‌تواند با نرم‌افزارها و وب‌سایت‌ها کار کند، فرم‌ها را تکمیل کند، داده‌ها را تحلیل کند، سند و فایل اکسل بسازد، وب‌سایت ایجاد کند و بسیاری از فرایندهای چندمرحله‌ای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارک‌ها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گسترده‌تر خواهد شد.

🔗 منبع OpenAI 🔗

🌀 @cvision 🌀
  • ❤ 7
  • 👀 5
  • 👏 2
Post #4385 4.7K
🔥 رقابت غول‌های تولید ویدئو با هوش مصنوعی!

چند روز پیش یک رقابت جذاب بین تعدادی از مطرح‌ترین مدل‌های تولید ویدئوی AI برگزار شد:

🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5

اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:

✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا

یعنی چیزی که می‌بینید، خروجی واقعی مدل‌ها در یک شرایط برابر است. 👀

حالا سؤال اصلی:

🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
  • 👏 12
  • 👍 5
  • 👀 3
Post #4384 3.79K
Tensorflow(@CVision) گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
from google import genai

client = genai.Client()

# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")

# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)

print(interaction.output_text)


دریافت api key
  • ❤ 16
  • 👍 2
Post #4383 3.41K
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥

هوش مصنوعی جدید علی‌بابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقع‌گرایانه وارد رقابت شده؛ مدلی که می‌تونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.

اگه دنبال ساخت ویدیوهای حرفه‌ای با هوش مصنوعی هستی، Wan 3.0 یکی از مدل‌هاییه که ارزش امتحان کردن داره. �
@cvision
  • ❤ 8
  • 👍 1
Post #4382 3.46K
Tensorflow(@CVision) گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
مدل جدید در مکالمه‌های واقعی می‌تواند مکث‌ها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را به‌صورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نام‌های خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️

یکی از جذاب‌ترین بخش‌ها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجه‌ها و جابه‌جایی بین زبان‌هاست. برای فایل‌های ضبط‌شده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل می‌تواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخه‌ی جداگانه‌ی gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشن‌های تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار می‌دهد. نسخه‌ی دیگر هم برای پردازش فایل‌های ضبط‌شده، جلسات و تماس‌ها در دسترس است. 🚀

از نظر بنچمارک هم اعداد جالب‌اند؛ طبق داده‌ای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکته‌ی مهم‌تر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمی‌بیند. این مدل در بعضی تجربه‌های Gemini می‌تواند با Context صفحه و مدل‌های دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و می‌تواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعه‌دهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio به‌صورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده می‌شود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐

به‌نظر می‌رسد رقابت مدل‌های صوتی حالا از «چه کسی دقیق‌تر صدا را متن می‌کند؟» عبور کرده و به سؤال بزرگ‌تری رسیده: چه کسی بهتر می‌تواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀

🌀 @cvision 🌀
  • ❤ 9
  • 🔥 3
Post #4381 3.24K
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠

گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی صدا نیست؛ مدل تلاش می‌کند خروجی را به شکل تمیز، ساختاریافته و قابل استفاده تحویل دهد.

🌀 @cvision 🌀
  • ❤ 10
  • 🔥 4
  • 👍 1
Post #4379 3.16K

Forwarded from 🚀 کلاس‌ویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته

یک خبر خوب برای اونایی که مدت‌هاست می‌خوان یه مهارت جدید یاد بگیرن 👇

با همکاری مکتب‌خونه، ۵۰۰ دوره آموزشی به‌صورت رایگان در طرح «ایران‌ماهر» در دسترس قرار گرفته. 🎓

چند تا از دوره‌های #کلاس_ویژن هم در این طرح قرار دادیم تا اگر تا امروز فرصت یا امکان تهیه‌شون رو نداشتید، بتونید با یکی از اون‌ها شروع کنید. 🌱

🔹 آموزش جامع یادگیری عمیق
🔹 ساخت هوش مصنوعی شخصی در مرورگر
🔹 آموزش مدل‌های زبانی-تصویری
🔹 آموزش پردازش تصویر

برای استفاده از این طرح، کافیه موقع ثبت‌نام کد IRANMAHER رو وارد کنید.

اگر مدت‌هاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت می‌تونه شروع خوبی باشه. ❤️

https://mktb.me/szs2/
  • ❤ 23
  • ❤‍🔥 2
  • 👏 1
Post #4378 5.37K
🎙 ـTypeless؛ ابزاری که تایپ کردن رو خیلی کمتر می‌کنه
ـTypeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل می‌کنه، اما نه به شکل ساده‌ی Voice to Text.
هنگام صحبت، تپق‌ها، تکرارها و اصلاحاتی که وسط جمله انجام می‌دید رو تشخیص می‌ده و در نهایت یک متن مرتب و قابل استفاده تحویل می‌ده.
مثلاً اگر بگید:
«جلسه رو بذاریم فردا... نه، بهتره پس‌فردا ساعت ۱۰ باشه»
خروجی نهایی می‌تونه این باشه:
«جلسه را برای پس‌فردا ساعت ۱۰ تنظیم کنیم.»
یکی از قابلیت‌های جالبش اینه که می‌تونه متن رو متناسب با فضای کاری شما تنظیم کنه؛ مثلاً برای ایمیل، پیام یا متن‌های روزمره.
همچنین از بیش از ۱۰۰ زبان پشتیبانی می‌کنه و نسخه‌های Windows، macOS، iOS و Android هم داره.
اگر زیاد با ایمیل، پیام، تولید محتوا یا نوشتن متن‌های کاری سروکار دارید، Typeless می‌تونه ابزار جالبی برای امتحان کردن باشه.
🔗 typeless.com

🌀 @cvision 🌀
  • 🔥 18
  • ❤ 3
Post #4377 4.88K
🚀 معرفی مدل ویدیوساز قدرتمند و جدید MiniMax H3
مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته می‌شود) به تازگی به صورت Open-Weights منتشر شده و امکانات بی‌نظیری را برای تولید محتوای ویدیویی در اختیار کاربران قرار داده است. این مدل توانایی رقابت با بهترین مدل‌های بسته بازار را دارد و حتی روی سیستم‌های لوکال (مثل ComfyUI) هم قابل اجراست.
*خبرخوب : به زودی براتون بصورت اختصاصی ورک فلو ها و مدل های خوبش رو قرار میدهیم*
  • ❤ 16
  • 👌 2
  • 👍 1
Post #4376 4.93K
install-watch.md18.5 KB
👁 درک عمیق و هوشمند ویدیوها با اسکیل /watch
با اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا می‌کنن!
ویژگی‌های کلیدی:
🎞 آنالیز فریم‌به‌فریم: درک دقیق و بصری از اتفاقات داخل تصویر.
🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگ‌ها و صدای روی ویدیو.
⚡️ راه‌اندازی تمام‌خودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیش‌نیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.
  • ❤ 15
Post #4375 5.04K
هز چه قدر پول بدی آش میخوری :)

چند روز داشتم یه پروژه‌ی RAG با Neo4j و LangChain کار می‌کردم. یه جای کار retriever همیشه نتیجه‌ی خالی برمی‌گردوند — امبدینگ‌ها سالم، ایندکس سالم، ولی هرچی می‌گشتم هیچی پیدا نمی‌شد.

توی یه دیسکاشن طولانی با Sonnet، کلی فرضیه و راه‌حل امتحان کردیم: نسخه‌ی پکیج، نوع مدل امبدینگ، search_type، حتی رفتیم سراغ ساخت retriever سفارشی و full-text index دستی — هرکدوم یه گوشه از مشکل رو حل می‌کرد ولی ریشه‌ی اصلی پیدا نمی‌شد.

راستش از اول تعمداً سراغ Fable نرفته بودم، چون نمی‌خواستم هزینه‌ی توکنم بالا بره. ولی بعد از حدود دو ساعت کلنجار رفتن، خسته شدم و گفتم یه امتحانی بکنم.

بردمش رو Fable، و تقریباً بلافاصله رسید به یه نکته‌ی ساده که تا اون لحظه هیچ‌کس (نه من، نه Sonnet) بهش دقت نکرده بود: توی ساخت Neo4jVector`، پارامتر `database رو ست نکرده بودم! یعنی داشت به دیتابیس پیش‌فرض Neo4j وصل می‌شد، نه به دیتابیسی که واقعاً داده توش بود. همه‌ی اون رفتارهای عجیب (نتیجه‌ی خالی، جواب‌های نامرتبط) از همین یه پارامتر جا‌مونده بود.

البته Fable واقعا گرونه، و به درد همین مواقع که آدم گیر میکنه میخوره...
  • ❤ 32
  • 👍 10
  • ⚡ 4
  • 🤔 3
  • 👀 1
Post #4373 4.02K
یادداشت شماره ۱:
درباره «مدلهای جهانی به عنوان بنیانهای شناختی برای AGI»
من یک مجموعه جدید درباره #WorldModels به عنوان زیربنای هوش_مصنوعی_عمومی (#AGI) شروع میکنم.

هوش مصنوعی فراتر از یادگیری ماشین سنتی و حتی #مدلهای_زبانی_بزرگ (#LLMs) امروزی به سرعت در حال تکامل است. یکی از هیجانانگیزترین پرسشها این است:
چگونه سیستمهای هوش_مصنوعی میتوانند یک درک درونی از جهان بسازند، درباره موقعیتهای جدید استدلال کنند، و پیش از اقدام، تصمیمهای بهتری بگیرند؟
WorldModels به عنوان گامی امیدوارکننده به سوی پاسخ به این پرسش ظهور کردهاند.
در این مجموعه، هم مبانی و هم پیشرفتهای اخیر در #WorldModels از #یادگیری_بازنمایی، #JEPA، و بازنماییهای نهان جهانی تا #MultimodalAI #Reasoning, #Planning, #Memory, #ReinforcementLearning #AutonomousAgents را بررسی خواهم کرد.
همچنین درباره تأثیر این ایدهها بر آینده #مدلهای_بنیادی، #رباتیک، #هوش_مصنوعی_در_سلامت، #هوش_مصنوعی_علمی و دیگر کاربردهای دنیای واقعی بحث خواهم کرد.
هدف من این است که این مفاهیم را با پیوند دادن نظریه زیربنایی با پژوهشهای روز، چالشهای مهندسی و پیادهسازیهای واقعی، عملی و قابل درک کنم. چه محقق باشید، چه #دانشمند_داده، چه #مهندس_یادگیری_ماشین، چه #مهندس_هوش_مصنوعی، یا صرفاً به آینده هوش مصنوعی علاقهمند باشید، امیدوارم این مجموعه برایتان باشد. مشتاقم تا در این مسیر با هم یاد بگیریم و نظراتتان را بشنوم.
مرجع تصویر: Y. LeCun, A Path Towards Autonomous Machine Intelligence (2022)
LinkedIn LinkedIn Login, Sign in | LinkedIn Login to LinkedIn to keep in touch with people you know, share ideas, and build your career.
  • 👍 6
  • ❤ 3
  • 👌 2
Older posts →

About this channel

How can I read @cvision without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Tensorflow(@CVision): recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Tensorflow(@CVision) have?
Tensorflow(@CVision) (@cvision) has 15.1K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Tensorflow(@CVision) know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →