634 matches found
augustus
Augustus - LLM脆弱性スキャナー(プロンプトインジェクション、脱獄、敵対的攻撃テスト用) Augustus - LLM脆弱性スキャナー プロンプトインジェクション、脱獄、エンコーディング悪用、データ抽出をカバーする210以上の敵対的攻撃で大規模言語モデルをテストします。 Augustus は、セキュリティ専門家向けのGoベースのLLM脆弱性スキャナーです。幅広い敵対的攻撃に対して大規模言語モデルをテストし、28のLLMプロバイダーと統合し、実用的な脆弱性レポートを生成します。...
attack-attention
有效攻击基础模型的注意力可有效扰乱下游任务 论文 "Attacking Attention of Foundation Models Effectively Disrupts Downstream Tasks" 的官方 PyTorch 实现,已被 CVPR 2025 的 ADVML (对抗性机器学习在计算机视觉中的应用:基础模型 + X)研讨会接收。 有效攻击基础模型的注意力可有效扰乱下游任务" Hondamunige Prasanna Silva、Federico Becattini 和 Lorenzo Seidenari 摘要:...
ai-llm-red-team-handbook
AI / LLM レッドチームフィールドマニュアル&コンサルタントハンドブック 大規模言語モデル(LLM)、AIエージェント、RAGパイプライン、AI対応アプリケーションに対するAI/LLMレッドチーム評価のための包括的な運用ツールキットです。このリポジトリは、戦術的な現場ガイダンスと戦略的なコンサルティングフレームワークの両方を提供します。 📖 GitBookナビゲーション: 完全な章構成はSUMMARY.mdを参照してください。 📚 概要 このリポジトリは、AI LLMレッドチームハンドブックのゴールドマスター...
offensive-ai-compilation
进攻性 AI 汇编 一份精选的涵盖进攻性 AI 的实用资源列表。 📁 目录 📁 🚫 滥用 🚫 🧠 对抗性机器学习 🧠 ⚡ 攻击 ⚡ 🔒 提取 🔒 ⚠️ 局限性 ⚠️ 🛡️ 防御措施 🛡️ 🔗 实用链接 🔗 ⬅️ 逆向(或推断) ⬅️ 🛡️ 防御措施 🛡️ 🔗 实用链接 🔗 💉 投毒 💉 🔓 后门 🔓 🛡️ 防御措施 🛡️ 🔗 实用链接 🔗 🏃♂️ 逃逸 🏃♂️ 🛡️ 防御措施 🛡️ 🔗 实用链接 🔗 🛠️ 工具 🛠️ ART Cleverhans 🔧 使用 🔧 🕵️♂️ 渗透测试 🕵️♂️ 🦠 恶意软件 🦠 🗺️ OSINT 🗺️ 📧 钓鱼 📧 👨🎤 生成式 AI 👨🎤 🔊 音频...
robustbench
RobustBench:一个标准化的对抗鲁棒性基准 Francesco Croce(蒂宾根大学)、Maksym Andriushchenko(洛桑联邦理工学院)、Vikash Sehwag(普林斯顿大学)、Edoardo Debenedetti(洛桑联邦理工学院)、 Nicolas Flammarion(洛桑联邦理工学院)、Mung Chiang(普渡大学)、Prateek Mittal(普林斯顿大学)、Matthias Hein(蒂宾根大学) 排行榜 :https://robustbench.github.io/ 论文: https://arxiv.org/abs/2010.09670...
deep-pwning
Deep-pwning is a lightweight framework for experimenting with machine learning models with the goal of evaluating their robustness against a motivated adversary. Note that deep-pwning in its current state is no where close to maturity or completion. It is meant to be experimented with, expanded...
deep-pwning
Deep-pwningは、機械学習モデルを対象に、意欲的な攻撃者に対する堅牢性を評価するための軽量フレームワークです。 現在の状態のdeep-pwningは、 成熟や完成には程遠い ことに注意してください。これは、あなたが実験し、拡張し、発展させていくことを意図しています。そうすることで初めて、真に 統計的機械学習モデルのための侵入テストツールキット となるのです。 背景 研究者たちは、機械学習モデル(分類器、クラスタリング器、回帰器など)をだまして客観的に誤った決定をさせることが驚くほど簡単であることを発見しました。この研究分野は 敵対的機械学習...
SecML
SecML: セキュアで説明可能な機械学習のためのライブラリ SecMLは、機械学習(ML)アルゴリズムのセキュリティ評価 のためのオープンソースPythonライブラリです。 強力な機能を備えています: 幅広いMLアルゴリズムのサポート。 scikit-learnでサポートされているすべての教師あり学習アルゴリズムと、PyTorch深層学習プラットフォームによるニューラルネットワーク(NN)が利用可能です。 組み込みの攻撃アルゴリズム。 カスタム開発された高速ソルバーに基づく回避攻撃およびポイズニング攻撃。さらに、他のサードパーティの敵対的機械学習ライブラリへのコネクタも提供します。...
OpenAttack
ドキュメント • 機能と用途 • 使用例 • 攻撃モデル • ツールキット設計 OpenAttack は、オープンソースの Python ベースのテキスト対向攻撃ツールキットであり、テキストの前処理、被害者モデルへのアクセス、対向例の生成、評価を含むテキスト対向攻撃の全プロセスを処理します。 機能と用途 OpenAttack には以下の機能があります: ⭐️ すべての攻撃タイプをサポート. OpenAttack は、文/単語/文字レベルの摂動と勾配ベース/スコアベース/判断ベース/ブラインド攻撃モデルを含むすべてのタイプの攻撃をサポートします; ⭐️ 多言語対応. OpenAttack...
PoisonCraft
PoisonCraft このリポジトリは、POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models の公式実装を提供します。 概要 POISONCRAFT は、悪意のある攻撃者が Retrieval-Augmented...
foolbox
home: true heroImage: /logo.png heroText: Foolbox tagline: "Foolbox:在 PyTorch、TensorFlow 和 JAX 中快速发起对抗攻击,以基准测试机器学习模型的鲁棒性" actionText: 开始使用 → actionLink: /guide/ features: title: 原生性能 details: Foolbox 3 基于 EagerPy 构建,可原生运行于 PyTorch、TensorFlow 和 JAX 中。 title: 最先进的攻击方法 details: Foolbox...
BrokenHill
!\ Broken Hill ロゴ \https://assets.kitploit.com/production/public/readmes/44608/c14154675c6f33f5c3887887afcdb39351c82f269ee2772cf31847106a20a871.jpg Broken Hill Broken Hill は、「Universal and Transferable Adversarial Attacks on Aligned Language Models」という論文(Andy Zou、Zifan Wang、Nicholas Carlini、Milad...
red-kube
kubectl ベースの Red Team K8S 敵対者エミュレーション Red Kube は、攻撃者の視点から Kubernetes クラスターのセキュリティ態勢を評価するために記述された kubectl コマンドのコレクションです。 コマンドは、データ収集や情報公開のための受動的なものと、クラスターに影響を与える実際のアクションを実行するための能動的なものがあります。 コマンドは MITRE ATT&CK 戦術に対応付けられており、どの領域に最もギャップがあるかを把握し、調査結果に優先順位を付けるのに役立ちます。 現在のバージョンは Python...
T-MAP
T-MAP: Red-Teaming de Agentes LLM con Búsqueda Evolutiva Consciente de la Trayectoria T-MAP es un marco de búsqueda evolutiva consciente de la trayectoria para el red-teaming de agentes LLM sobre servidores MCP. Genera y muta iterativamente prompts adversariales guiados por trayectorias de...
AI-Red-Teaming-Playground-Labs
AI Red Teaming Playground Labs このリポジトリには、コース「AI Red Teaming in Practice」で使用されるラボのチャレンジが含まれています。このコースは元々、Black Hat USA 2024 で Dr. Amanda Minnich と Gary Lopez によって教えられました。Martin Pouliot がチャレンジのインフラストラクチャとスコアリングを担当しました。チャレンジは Dr. Amanda Minnich、Gary Lopez、Martin Pouliot...
awesome-ai-security — Updated!
awesome-ai-security A curated list of AI Security materials and resources for Pentesters, Bug Hunters, and Security Researchers. root@kitploit: If you find that some links are not working, you can simply replace the username with gmh5225. Or you can send an issue for me. Show respect to all the...
Johnny Still Receives Spam SMS: Assessing the Robustness of SMS Spam Detection
SMS spam detection systems often achieve high accuracy in controlled environments but struggle against adversarial attacks and increasingly sophisticated spam tactics in real-world deployments. In this paper, we evaluate the robustness of SMS anti-spam systems that end users actually rely on,...
cleverhans
CleverHans(最新版本:v4.0.0) 本仓库包含 CleverHans 的源代码,这是一个用于评估机器学习系统对 对抗样本 漏洞的 Python 库。 你可以在随附的 博客 上了解更多关于此类漏洞的信息。 CleverHans 库持续开发中,始终欢迎 贡献 最新的攻击和防御方法。 特别是,我们始终欢迎帮助解决当前 开放的问题。 自 v4.0.0 起,CleverHans 支持 3 种框架:JAX、PyTorch 和 TF2。我们目前优先在 PyTorch 中实现攻击, 但非常欢迎为所有 3 种框架做出贡献。在 v3.1.0 及更早版本中, CleverHans 支持...
robustness
robustness 包 通过 pip 安装:pip install robustness 阅读文档:https://robustness.readthedocs.io/en/latest/index.html robustness 是我们(MadryLab 的学生)创建的一个软件包,旨在让神经网络的训练、评估和探索变得灵活而简单。我们几乎在所有项目中使用它(无论是否涉及对抗训练!),并且它将成为我们许多即将发布的代码的依赖项。使用该库的一些项目包括: 《Learning Perceptually-Aligned Representations via Adversarial...
ActBench
ActBench ActBench is a self-evolving benchmark of behavioral safety in cowork agents. It defines behavioral safety as whether an agent's execution remains within the permissions and state changes required by a benign task, and evaluates realized behavioral risk from execution trajectories rather...