Lucene search
+L

9 matches found

Kitploit
Kitploit
added 2026/08/26 6:37 a.m.1 views

CTFTiny

CTFTiny: लार्ज लैंग्वेज मॉडल्स में आक्रामक साइबर कौशल की लाइट बेंचमार्किंग यह CTFTiny का आधिकारिक रिपॉज़िटरी है, जो "Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark" AAAI'26 पेपर से लिया गया है। CTFJudge के लिए, कृपया CTFJudg...

5.5AI score
SaveExploits0References2
Kitploit
Kitploit
added 2026/08/25 10:37 p.m.2 views

bloom

ब्लूम: LLMs के लिए स्वचालित व्यवहारिक मूल्यांकन !IMPORTANT ब्लूम का नया घर है। अब इसे Meridian Labs द्वारा विकसित और अनुरक्षित किया जाता है और यह meridianlabs-ai.github.io/petribloom पर रहता है — सभी नई सुविधाएँ और सुधार वहाँ आएंगे। यह रिपॉजिटरी अपने अंतिम स्टैंडअलोन रिलीज़ पर स्थिर है और इसे अपड...

5.4AI score
SaveExploits0References1
Kitploit
Kitploit
added 2026/08/25 8:40 p.m.1 views

promptfoo

Promptfoo: LLM मूल्यांकन और रेड टीमिंग promptfoo एक CLI और लाइब्रेरी है LLM ऐप्स का मूल्यांकन और रेड-टीमिंग करने के लिए। परीक्षण-और-त्रुटि दृष्टिकोण को रोकें - सुरक्षित, विश्वसनीय AI ऐप्स शिप करना शुरू करें। वेबसाइट · शुरू करना · रेड टीमिंग · दस्तावेज़ीकरण ·...

5.4AI score
SaveExploits0References2
Kitploit
Kitploit
added 2026/08/25 8:05 p.m.1 views

claude_opus_cve_2023_0266

إثبات أن Claude 3 Opus لا يفهم CVE-2023-0266 ولا يعثر عليه العرض التوضيحي 1. حتى لو تم إخبار Opus بمكان الخلل، فإنه لا يعثر عليه، ويهلوس بوجود عمليات قفل العرض التوضيحي 2. "هندسة المطالبات" أي إخبار LLM بالضبط بكيفية العثور على الخلل لا تعمل أيضًا العرض التوضيحي 3. يصف هذا المنشور في مدونة Projec...

7.9CVSS6.7AI score0.03702EPSS
SaveExploits0
Kitploit
Kitploit
added 2026/08/25 4:13 a.m.2 views

redteam-ai-benchmark

معيار الذكاء الاصطناعي للفريق الأحمر النسخة الروسية: README.ru.md معيار الذكاء الاصطناعي للفريق الأحمر هو معيار تقييم نموذج لواجهة سطر الأوامر. يقيس مدى فهم نماذج اللغة الكبيرة للإجابة على أسئلة الفريق الأحمر وسيناريوهات الأمان؛ إنها ليست أداة لتنفيذ هذه الأنشطة. الإصدار 2 يستخدم مجموعة بيانات...

5.5AI score
SaveExploits0References2
Kitploit
Kitploit
added 2026/08/24 10:26 a.m.1 views

MalEval

MalEval مقال: هل «معرفة أنه خبيث» كافٍ؟ تقييم نماذج اللغات الكبيرة للتدقيق الدقيق في سلوك البرمجيات الخبيثة DOI المقال: 10.1145/3832187 MalEval هو إطار عمل لتقييم تقارير سلوك البرمجيات الخبيثة لنظام أندرويد المُولَّدة بواسطة نماذج اللغات الكبيرة. ينفّذ الكود الموجود في هذا المستودع مسارين للتنفيذ...

5.4AI score
SaveExploits0References1
Kitploit
Kitploit
added 2026/08/24 4:16 a.m.1 views

reverse-captcha-eval

Reverse CAPTCHA: Оценка подверженности LLM невидимой инъекции инструкций в Unicode Фреймворк для оценки, проверяющий, следуют ли большие языковые модели невидимым инструкциям, закодированным в Unicode и внедрённым в иначе обычный текст. В то время как традиционные CAPTCHA эксплуатируют задачи,...

6AI score
SaveExploits0References1
Packet Storm News
Packet Storm News
added 2025/12/26 12:00 a.m.10 views

Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection

Large Language Models LLMs have demonstrated significant potential in automated software security, particularly in vulnerability detection. However, existing benchmarks primarily focus on isolated, single-vulnerability samples or function-level classification, failing to reflect the complexity of...

7AI score
SaveExploits0
Packet Storm News
Packet Storm News
added 2025/08/22 12:00 a.m.10 views

LLM-GUARD: Large Language Model-Based Detection and Repair of Bugs and Security Vulnerabilities in C++ and Python

Large Language Models LLMs such as ChatGPT-4, Claude 3, and LLaMA 4 are increasingly embedded in software/application development, supporting tasks from code generation to debugging. Yet, their real-world effectiveness in detecting diverse software bugs, particularly complex, security-relevant...

7.2AI score
SaveExploits0
Rows per page
Query Builder