4493 matches found
dataset
🚀 CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models 🛡️ The largest and most comprehensive Generative AI-based CyberSecurity-focused Dataset for Benchmarking Large Language Models 🌟 Overview The CySecBench paper offers: 🎯 A cutting-edge...
CL4R1T4S
CL4R1T4S AI SYSTEMS TRANSPARENCY AND OBSERVABILITY FOR ALL! Full extracted system prompts, guidelines, and tools from OpenAI, Google, Anthropic, xAI, Perplexity, Cursor, Windsurf, Devin, Manus, Replit, and more – virtually all major AI models + agents! 📌 Why This Exists root@kitploit: "In order t...
agent-scan
Snyk Agent Scan Discover and scan agent components on your machine for prompt injections and vulnerabilities including agents, MCP servers, skills. Note: CLI output is experimental and subject to change Agent Scan v0.5.x planned for deprecation The raw output of this CLI — including issue codes,...
EUVD-2026-77913
A permissions issue was addressed with improved state management. This issue is fixed in macOS Golden Gate 27. An app may be able to bypass Apple Intelligence security prompts...
agent-vault
HTTPクレデンシャルプロキシ&ボールト Infisical によるオープンソースのクレデンシャルブローカーで、エージェントとそれらが呼び出すAPIの間に位置します。 エージェントはクレデンシャルを保持すべきではありません。Agent Vaultはブローカーアクセスにより、クレデンシャル流出リスクを排除します。 初めてですか?ローンチブログ記事でAgent Vaultの全貌をご覧ください。 ドキュメント | インストール | チュートリアル | ビデオデモ | Slack Agent Vaultの必要性...
Exponentiated-Gradient-Descent-LLM-Attack
Readmeファイルを変更する。 これは、整列された大規模言語モデルを攻撃するための敵対的サフィックスを生成するために、Exponentiated Gradient Descent最適化手法を探求するプロジェクトです。 この手法は、70億パラメータのLlama-2チャットモデルに対して有効であることが示されています。 pgdスクリプトを複数のビヘイビア(例:20)で実行するには、シェルで以下のコマンドを実行します。 python runpgd.py --inputfile...
augustus
Augustus - LLM脆弱性スキャナー(プロンプトインジェクション、脱獄、敵対的攻撃テスト用) Augustus - LLM脆弱性スキャナー プロンプトインジェクション、脱獄、エンコーディング悪用、データ抽出をカバーする210以上の敵対的攻撃で大規模言語モデルをテストします。 Augustus は、セキュリティ専門家向けのGoベースのLLM脆弱性スキャナーです。幅広い敵対的攻撃に対して大規模言語モデルをテストし、28のLLMプロバイダーと統合し、実用的な脆弱性レポートを生成します。...
AutoRAN-public
🧠 AutoRAN:大型推理模型中安全推理的自动化劫持 AutoRAN 是一种自动化的安全推理劫持方法,利用对齐程度较低(次要)的辅助模型模拟推理轨迹、生成叙事性提示,并迭代优化这些提示,以绕过现代大型推理模型(LRMs)中的安全推理。 ⚠️ 免责声明 :本仓库仅用于受控安全研究和 AI 安全红队测试。 🔍 核心特性 ⚙️ 自动化多轮越狱 :通过迭代提示优化实现 🧩 叙事模板 :在看似合理的教育/道德幌子下包装恶意目标 🔁 优化策略 :利用中间推理轨迹演化提示 📈 在商业 LRM 上近乎 100% 的攻击成功率 🔬 在 AdvBench 、HarmBench 和 StrongReject...
CVE-2026-24055-OAuth-Langfuse
CVE-2026-24055 — Unauthenticated Slack OAuth Install in Langfuse Đồ án môn Bảo mật Web và Ứng dụng — Nhóm 06, lớp NT213.Q21.ANTT 📌 Tóm tắt Dự án tái hiện lại reproduce một lỗ hổng bảo mật thực tế đã được công bố CVE-2026-24055 trên nền tảng Langfuse — một endpoint OAuth cho phép kẻ tấn công chiếm...
promptmap
root@kitploit: O O o.-. Humans, Do Not Resist! |/ ,-'-. / /, / /|.-.| / --O-- .--""" /\ /\ | o.o / Utku Sen's /|\ -'--' / /| | - | / | | | \ /| | | ' \ '/ \ ' | ' \ | ' / | ' \ | / | | | ./| /||| ./|||,| .// / / |-----| || || || || promptmap2 is a an automated prompt injection scanner for...
promptmap
root@kitploit: O O o.-. Humans, Do Not Resist! |/ ,-'-. / /, / /|.-.| / --O-- .--""" /\ /\ | o.o / Utku Sen's /|\ -'--' / /| | - | / | | | \ /| | | ' \ '/ \ ' | ' \ | ' / | ' \ | / | | | ./| /||| ./|||,| .// / / |-----| || || || ||...
memory-poisoning-axis
memory-poisoning-axis Medición determinista de envenenamiento de memoria / inyección de prompts — anclada a CVE-2026-24301 "CoSnitch" Microsoft Copilot Personal, CVSS 3.1 8.8, parcheado el 18 ago 2026. CoSnitch encadenaba: i ejecución automática de prompts ?q= + ?autorun=1 no documentado, ii...
SecOPD
SecOPD: 通过在线策略蒸馏缓解自适应提示注入 Yibo Peng · Long Lian · David Wagner† · Sizhe Chen† † 联合指导。 论文 项目主页 模型 本版本实现了论文中最终的 全响应 KL 公式,也即 无解析 变体。学生模型在受攻击的上下文下进行 rollout。一个由相同基础模型初始化的干净上下文教师模型,在配对的干净上下文下对学生模型采样的 token 进行评分。反向 KL 信号应用于每个采样的响应 token,包括推理 token;不使用 边界来选择监督跨度。 仓库结构 training/tinker/:全响应 KL...
StepJack
StepJack:针对多步间接提示注入的计算机使用智能体安全基准测试 环境配置 1. Python 环境配置 首先,安装所有依赖项,并确保你运行的是 Python 3.10。 root@kitploit: conda create -n stepjack python=3.10 conda activate stepjack pip install -r requirements.txt 2. 沙箱环境配置 我们使用 RedTeamCUA 提供的 AWS 环境。 AWS 1. 配置 NETWORKINTERFACEMAP: 根据你自己的 AWS 实例,在 awsconfig.py 中配置...
clawshield-public
ClawShield 面向 AI 代理的安全代理。 置于 OpenClaw 之前,在消息到达模型或离开网络之前,对每条消息进行提示注入、PII 泄露和机密扫描。 附带 5 个专用 AI 代理、内置仪表板和一个 YAML 策略引擎。一条命令即可启动。 root@kitploit: ┌──────────────┐ ┌──────────────────┐ ┌──────────────┐ │ Browser │────▶│ ClawShield │────▶│ OpenClaw │ │ you │◀────│ Security Proxy │◀────│ Gateway │...
wardgate
Wardgate - Puerta de Seguridad para Agentes de IA Wardgate es una puerta de seguridad que se sitúa entre los agentes de IA y el mundo exterior: aísla las credenciales para las llamadas API, aísla las claves SSH para la ejecución remota de comandos y controla la ejecución de comandos en entornos...
LLMMap
LLMMap LLMMap は、LLM統合アプリケーション向けの自動プロンプトインジェクションテストフレームワークです。HTTPリクエスト内のインジェクションポイントを発見し、デュアルLLMアーキテクチャを使用して標的型攻撃プロンプトを生成し、対象に送信し、統計的信頼性テストで結果を確認します。sqlmapから着想を得て、LLMMapはLLMセキュリティテストに同じ系統的でエビデンスに基づくアプローチをもたらします。 法的免責事項:...
SharpCookieMonster
SharpCookieMonster root@kitploit: .&@. .@@. &&&@ @/ @ @ & ,& &@@@@/ &/ @ &@ @@@@@@@@ @. @. @@/ @ @@@@@@@/ @, @@ @ @@@@@@@@ && %%/%%&//... /% @@@@@@@@ @ ,@///////@. .@..@, %@@ &/////@@. .&@/////////////////&@. &%///@. &/////////////////////////%@...
PROMPTPurify
promptpurify 用于LLM聊天应用的微型提示注入防火墙。约14 MB。仅需CPU。 可嵌入用户输入与大模型之间的防护——运行在同一台机器上,无需GPU、无需API、无需额外服务。 由SecureLayer7红队打造。大多数开源护栏体积达数百MB,需要GPU,且仍然遗漏我们在生产环境中看到的攻击。我们需要一个可以在自己的AI产品和客户应用内部署的东西,而不需要任何这些东西。 为什么存在 与开源基线的基准对比 → docs/BENCHMARKS.md。 安装 root@kitploit: SDK(零依赖,约50 KB)——结构防火墙 + 浏览器捆绑包 npm i...