10 matches found
bloom
Bloom: LLMのための自動行動評価 !IMPORTANT Bloomは新しいホームに移転しました。 現在はMeridian Labsによって開発・メンテナンスされており、meridianlabs-ai.github.io/petribloomにあります。新しい機能や修正はすべてこちらに追加されます。 このリポジトリは最後のスタンドアロンリリースで凍結されており、アップデートは行われません。既存のユーザーは以下に記載されている通りに引き続き使用できますが、新しいプロジェクトはMeridian Labsバージョンから開始してください。...
CTFTiny
CTFTiny: 大規模言語モデルにおける攻撃的サイバースキルの軽量ベンチマーク これは、「Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark」AAAI'26 で発表された CTFTiny の公式リポジトリです。論文 CTFJudge については、CTFJudge 公式リポジトリ を参照してください。 チャレンジ一覧 カテゴリ| イベント| 名前| 難易度 ---|---|---|--- cry|...
MalEval
MalEval 論文: 「悪質だと分かっているだけで十分か? マルウェアのきめ細かな動作監査におけるLLMの評価」 論文DOI: 10.1145/3832187 MalEval は、大規模言語モデルによって生成されたAndroidマルウェアの挙動レポートを評価するためのフレームワークです。このリポジトリのコードは、次の2つの実行パスを実装しています。 1. APKから : APKファイルに対して静的解析を実行し、エントリポイント、コールチェーン、関数本体、到達可能な関数を生成します。 2. アーティファクトから :...
promptfoo
Promptfoo: LLM 評価 & レッドチーミング promptfoo は、LLMアプリの評価とレッドチーミングのためのCLIおよびライブラリです。試行錯誤のアプローチをやめ、安全で信頼性の高いAIアプリを出荷しましょう。 ウェブサイト · はじめに · レッドチーミング · ドキュメント · Discord...
reverse-captcha-eval
リバースCAPTCHA: 大規模言語モデルの不可視ユニコード命令インジェクションに対する脆弱性評価 通常のテキストに埋め込まれた不可視のUnicodeエンコード命令を大規模言語モデルが実行するかどうかをテストする評価フレームワーク。従来のCAPTCHAが人間には解けるが機械には解けないタスクを利用するのに対し、リバースCAPTCHAは機械がアクセスできるが人間にはできない知覚チャネルを利用します。 論文: paper/reversecaptcha.pdf 主な発見 5つのモデル(GPT-5.2、GPT-4o-mini、Claude Opus 4、Claude Sonnet 4、Claud...
claude_opus_cve_2023_0266
演示:Claude 3 Opus 不理解 CVE-2023-0266 并且无法找到它(演示 1)。 即使告诉 Opus 漏洞在哪里,它也找不到,并且会幻觉出存在锁获取(演示 2)。 “提示工程”(也就是确切地告诉 LLM 如何找到该漏洞)同样不起作用(演示 3)。 这篇 Project Zero 博客文章 描述了 该漏洞。简而言之,有两条路径可以到达 sndctlelemwrite 函数。其中一条如下所示,并且是安全的: root@kitploit: sndctlioctl - sndctlelemwriteuser - sndctlelemwrite 而另一条路径如下所示,并且是不安全...
redteam-ai-benchmark
Red Team AI ベンチマーク ロシア語版: README.ru.md Red Team AI Benchmarkは、CLIのモデル評価ベンチマーク です。これは、LLMがレッドチームの質問やセキュリティシナリオをどのように理解し応答するかを測定します。これらの活動を実行するためのツールではありません。バージョン2では、1つの正解に対してのみ回答を評価するのではなく、ルーブリックベースのデータセットを使用しています。 デフォルトのv2スイートは、datasets/v2/benchmark.jsonlに60の質問を含み、ドメインと難易度でグループ化されています。 リポジトリのステータ...
promptfoo v0.122.1
Promptfoo: LLM evals & red teaming promptfoo is a CLI and library for evaluating and red-teaming LLM apps. Stop the trial-and-error approach - start shipping secure, reliable AI apps. Website · Getting Started · Red Teaming · Documentation · Discord Promptfoo is now part of OpenAI. Promptfoo...
Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection
Large Language Models LLMs have demonstrated significant potential in automated software security, particularly in vulnerability detection. However, existing benchmarks primarily focus on isolated, single-vulnerability samples or function-level classification, failing to reflect the complexity of...
LLM-GUARD: Large Language Model-Based Detection and Repair of Bugs and Security Vulnerabilities in C++ and Python
Large Language Models LLMs such as ChatGPT-4, Claude 3, and LLaMA 4 are increasingly embedded in software/application development, supporting tasks from code generation to debugging. Yet, their real-world effectiveness in detecting diverse software bugs, particularly complex, security-relevant...