23522 matches found
xmloxide
xmloxide libxml2 の純Rust再実装 — オープンソース世界で事実上の標準XML/HTMLパースライブラリです。 libxml2は2025年12月に公式メンテナンス終了となり、既知のセキュリティ問題を抱えています。xmloxideは、メモリ安全かつ高性能で、同じ適合性テストスイートを通過する代替品を目指します。 特徴 メモリ安全 — アリーナベースのツリーで、公開APIにunsafeを一切含みません 適合性 — W3C XML適合性テストスイートで100%の合格率(1727/1727の該当テスト) エラーリカバリ —...
GuardReasoner-VL
GuardReasoner-VL:通过强化推理保护 VLM Yue Liu, Shengfang Zhai, Mingzhe Du Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi 1新加坡国立大学, 2南洋理工大学 为了提升 VLM 的安全性,本文提出了一种新颖的基于推理的 VLM 护栏模型,命名为 GuardReasoner-VL。 其核心思想是通过在线 RL,激励护栏模型在做出审核决策之前进行深思熟虑的推理。...
mcpsafetywarden
MCP Safety Wardenは、任意のMCPサーバーをラップし、動作プロファイリング、セキュリティスキャン、リスクゲーティング、安全な実行をそのツールに追加するプロキシサーバーです。...
meta-ai-support-prompt
Meta AI サポートアシスタント システムプロンプト MetaのAIサポートアシスタントから抽出されたシステムプロンプト(2026年6月1日 時点)。 ファイル system-prompt.md — 抽出されたシステムプロンプト ⚠️ 免責事項および法的通知 目的 このリポジトリは、教育および正当なセキュリティ研究目的のみ のために公開されています。ここに含まれる資料は、AIシステムセキュリティ、プロンプトインジェクション防御、および大規模言語モデルの安全性についての理解を深めることのみを目的としており、他の目的は一切ありません。 許可された研究...
ActBench
ActBench ActBench is a self-evolving benchmark of behavioral safety in cowork agents. It defines behavioral safety as whether an agent's execution remains within the permissions and state changes required by a benign task, and evaluates realized behavioral risk from execution trajectories rather...
safety
!NOTE Come and join us at SafetyCLI. We are hiring for various roles. Table of Contents Table of Contents Introduction Key Features Getting Started GitHub Action Command Line Interface 1. Installation 2. Log In or Register...
safety
!NOTE SafetyCLI にぜひご参加ください。さまざまな職種で採用中です。 目次 目次 はじめに 主な機能 はじめに GitHub Action コマンドラインインターフェース 1. インストール 2. ログインまたは登録 3. 初回スキャンの実行 基本コマンド サービスレベルアグリーメント(SLA)...
saffron
Saffron-1:面向LLM安全保证的推理扩展 📖 论文 🛠️ 依赖 代码在以下依赖环境中测试通过: Python 3.12.3 CUDA 12.2 typingextensions==4.14.0 numpy==2.2.6 torch==2.5.1 huggingfacehub==0.30.2 accelerate==1.1.1 datasets==3.1.0 evaluate==0.4.3 transformers==4.45.2 peft==0.15.0 deepspeed==0.16.7 🚀 用法 请参见 saffron.py。更多描述即将推出... 📊 结果...
heretic
Heretic: 言語モデルのための完全自動検閲除去 Hereticは、高価なポストトレーニングを必要とせずに、トランスフォーマーベースの言語モデルから検閲(別名「セーフティアラインメント」)を除去するツールです。高度な実装の方向性アブレーション(「アブリテレーション」としても知られる、Arditi et al. 2024、Lai 2025(1、2))と、Optunaを搭載したTPEベースのパラメータ最適化器を組み合わせています。 このアプローチにより、Hereticは完全に自動的に...
nano-analyzer
Nano-analyzer AISLE https://aisle.com による、LLMを活用した最小限のゼロデイ脆弱性スキャナー。 デモンストレーション目的の研究プロトタイプ。 これは単一ファイルのシンプルなハーネスであり、実際のゼロデイ脆弱性を検出できます。ただし、これはプロトタイプであり、C/C++のメモリ安全性バグに偏っており、誤検出を生じることに注意してください。オープンリサーチの精神に則り、現状のまま共有しています。予期せぬ動作があるかもしれません。 機能 Nano-analyzer...
AutoRAN-public
🧠 AutoRAN:大型推理模型中安全推理的自动化劫持 AutoRAN 是一种自动化的安全推理劫持方法,利用对齐程度较低(次要)的辅助模型模拟推理轨迹、生成叙事性提示,并迭代优化这些提示,以绕过现代大型推理模型(LRMs)中的安全推理。 ⚠️ 免责声明 :本仓库仅用于受控安全研究和 AI 安全红队测试。 🔍 核心特性 ⚙️ 自动化多轮越狱 :通过迭代提示优化实现 🧩 叙事模板 :在看似合理的教育/道德幌子下包装恶意目标 🔁 优化策略 :利用中间推理轨迹演化提示 📈 在商业 LRM 上近乎 100% 的攻击成功率 🔬 在 AdvBench 、HarmBench 和 StrongReject...
redeval
RedEval - Marco de evaluación de seguridad de LLM Un marco integral para evaluar la seguridad de los modelos de lenguaje de gran escala LLM mediante pruebas sistemáticas de ataque y rechazo. RedEval proporciona una plataforma unificada, segura y extensible para evaluar la robustez de los LLM fren...
clr
CLR C hecker of L ifetimes and other R efinement types for Zig 動画: https://www.youtube.com/watch?v=mf0WzTOe-40 スポンサー募集: https://buymeacoffee.com/dnautics HNで議論: https://news.ycombinator.com/item?id=42923829 lobste.rsで議論: https://lobste.rs/s/9sitsj/clrcheckerforlifetimesother ライブデモ動画:...
autoguardrails
autoguardrails Santander AI Lab によるオープンソース。 LLM / AI 安全性 ガードレール研究のための ライブラリ / 評価ハーネス autoresearch スタイル: 固定された評価スイートに対して攻撃成功率 ASR を最小化し、良性通過フロアを維持するために、単一の可変 policy.md サーフェスを探索します。 Santander AI Open Source の一部 — Banco Santander santander.com によるオープンソース AI プロジェクト。 autoguardrails は、Karpathy の...
delirium-ai-safety-benchmark
Delirium AI Safety Benchmark Affective Contextual Erosion(ACE)および関連するリミナル攻撃ベクトルに対するLLMの脆弱性を測定するための診断フレームワーク。 Delirium は悪用ツールではありません。これは、言語モデルの注意重みがシステムプロンプトに従う状態から、創発的な対人パターンに従う状態へと切り替わる正確な瞬間を——害が生じる前に——検出するために設計された、標準化されたベンチマークです。 ⚠️ 倫理憲章 1. 診断のみ — Delirium は調査・測定・報告を行います。悪用はしません。 2. キルスイッチ —...
kalitorify
Transparent Proxy through Tor for Kali Linux About kalitorify kalitorify is a shell script for Kali Linux which use iptables settings to create a Transparent Proxy through the Tor Network , the program also allows you to perform various checks like checking the Tor Exit Node i.e. your public IP...
Mozilla Thunderbird < 156.0
The version of Thunderbird installed on the remote macOS or Mac OS X host is prior to 156.0. It is, therefore, affected by multiple vulnerabilities as referenced in the mfsa2026-94 advisory. - Privilege escalation in the Enterprise Policies component. This vulnerability was fixed in Firefox 156,...
CVE-2026-92239
A maliciously constructed IMAP line could cause an out-of-bounds buffer read. This vulnerability was fixed in Thunderbird 156, Thunderbird 140.16, and Thunderbird 153.3...
DEBIAN-CVE-2026-92238
A maliciously constructed mail header could lead to multiple fields being parsed as one, or potential memory safety violations. This vulnerability was fixed in Thunderbird 156, Thunderbird 140.16, and Thunderbird 153.3...
CVE-2026-92238
A maliciously constructed mail header could lead to multiple fields being parsed as one, or potential memory safety violations. This vulnerability was fixed in Thunderbird 156, Thunderbird 140.16, and Thunderbird 153.3...