1649 matches found
Defenses-for-Tool-Integrated-LLM
도구 통합 LLM 에이전트의 적대적 공격 방어를 위한 범용 방어 기법 이 저장소에는 도구 통합 대규모 언어 모델LLM 에이전트를 적대적 공격으로부터 방어하는 프로젝트의 코드와 실험이 포함되어 있습니다. 개요 우리는 Agent Security Bench ASB를 기반으로 하여, 도구와 구조화된 추론예: 사고 연쇄, 성찰을 통합하는 것이 여러 작업 시나리오에서 LLM 에이전트의 적대적 프롬프트 취약성에 어떤 영향을 미치는지 평가합니다. 이 저장소에는 다음이 포함됩니다: 새로운 방어 전략예: 도구 기반 필터링,...
Scrapegraph-ai v2.3.1
🚀 Looking for an even faster and simpler way to scrape at scale only 5 lines of code? Check out our enhanced version at ScrapeGraphAI.com! 🚀 🕷️ ScrapeGraphAI: You Only Scrape Once English | 中文 | 日本語 | 한국어 | Русский | Türkçe | Deutsch | Español | français | Português | Italiano ScrapeGraphAI is a...
o3_finds_cve-2025-37899
기반 o3를 사용하여 CVE-2025-37899, Linux 커널의 SMB 구현에서 원격 제로데이 취약점을 찾은 방법 대상 취약점 ollama 취약점 CVE-2024-37032 https://github.com/ollama/ollama/releases/tag/v0.1.34 https://github.com/ollama/ollama/compare/v0.1.33...v0.1.34 커밋: 2a21363 다음을 사용하여 llm CLI pip install llm llm keys set openai llm --sf...
Xalgorix Autonomous AI Pentesting Agent 4.6.153
Most scanners detect. Xalgorix proves. An autonomous LLM agent works a full pentest methodology, then an independent verifier re-exploits every finding before it's reported - so you get proof, not a pile of maybes to triage. Self-hosted, private, and bring-your-own-LLM. Built in Go + TypeScript...
T-MAP
T-MAP: 궤적 인식 진화 탐색을 통한 LLM 에이전트 레드팀 테스트 T-MAP 은 MCP 서버에서 LLM 에이전트를 레드팀 테스트하기 위한 궤적 인식 진화 탐색 프레임워크입니다. 실행 궤적을 기반으로 적대적 프롬프트를 반복적으로 생성하고 변형하여 다양한 위험 범주와 공격 스타일에 걸쳐 에이전트의 취약점 지형을 매핑합니다. 🔧 설정 pip install -r requirements.txt 요구 사항: Python 3.11+, 공격자 및 대상 모델용 API 키, 하나 이상의 MCP 서버에 대한 액세스 권한. 🚀 빠른 시작 단일...
linux-kernel-codex-harness
Kernel Codex Harness 한국어 | English Research Tool · Original Import: 3 April 2026 · Documentation Revision: 11 July 2026 Core Philosophy — External Signal Let reproducible observations outside model inference guide attention; never mistake priority for proof. Project status. 이 저장소는 실제 Linux 커널 취약점...
llm-council-vapt
LLM Council — VAPT 취약점 발견 검증 클라이언트에게 전달되기 전에 침투 테스트 결과취약점 발견를 검증하는 블라인드 피어 리뷰 파이프라인입니다. 독립적인 전문가 관점렌즈이 결과를 평가하고, 서로 블라인드 리뷰를 수행하며, 의장Chairman이 하나의 검증된 평결을 종합합니다. 보고할 가치가 있는지, 심각도가 적절히 조정되었는지 여부를 판단합니다. 두 가지 실행 방식: 모드| 위치| 설명 ---|---|--- 수동 의장 Manual Chairman| claude.ai / Claude 앱 채팅| 각 렌즈를 개별적으로...
IPI-exposure-signal
IPI 노출 신호 본 논문의 코드 저장소입니다: 당신의 에이전트 LLM은 간접 프롬프트 인젝션 노출의 잠재 신호를 은밀하게 인코딩합니다. ArXiv 버전 및 논문 링크: https://arxiv.org/abs/2608.02657 이 저장소는 잠재 IPI 노출 신호를 위한 프로빙 파이프라인을 구현합니다: AgentDojo 트레이스 수집, IPI 위험 라벨링, 히든 스테이트 특성화featurization, 그리고 IPI 노출 프로브 훈련/평가. 인용 @miscdong2026agenticllmssecretlyencode,...
gemini-2.5-pro-nf-tables-red-teaming
Gemini 2.5 Pro nftables 레드 팀링 사례 연구 CVE-2023-32233 LLM 안전성 연구 | 책임 있는 공개 | AI 정렬 평가 연구자 : Niranj R Mahaswar Destawell Google AI 취약점 보상 프로그램 : 889286 — 범위 외 개요 이 저장소는 Linux 커널 취약점 CVE-2023-32233nftables 경쟁 조건 / Use-After-Free의 기술적 프리미티브와 관련하여 최첨단 모델들을 대상으로 한 비교 LLM 레드 팀링 실험을 기록합니다. 핵심 결과 2026년 4월...
promptfoo v0.124.0
Promptfoo: LLM evals & red teaming promptfoo is a CLI and library for evaluating and red-teaming LLM-based apps. Stop using trial-and-error... start shipping secure, reliable agents Website · Getting Started · Red Teaming · Documentation · Discord Promptfoo is now part of OpenAI. Promptfoo remain...
Rubrics-as-an-Attack-Surface
공격 표면으로서의 루브릭: LLM 심사자에서의 은밀한 선호 드리프트 📊 데이터셋 • 🤖 학습된 모델 • 📝 논문 • 💻 저장소 이 저장소는 Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Steven Wu, Zhun Deng가 작성한 논문 공격 표면으로서의 루브릭: LLM 심사자에서의 은밀한 선호 드리프트의 코드를 포함하고 있습니다. 우리는 LLM 기반 평가 및 정렬 파이프라인에서의 루브릭 유발 선호 드리프트Rubric-Induced Preference Drift, RIPD 를 연구하며,...
INTACT
SoK 다중 턴 탈옥 실험 이 저장소는 SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks의 메커니즘 분석에 사용된 코드의 릴리스 버전을 포함합니다. 저장소는 논문 부록 A에 설명된 실험에 필요한 코드, 프롬프트, 구성 파일 및 데이터셋만 유지하도록 정리되었습니다. 생성된 로그, 캐시된 파일, 가상 환경, 이전 결과, 그림 및 임시 분석 출력은 의도적으로 제거되었습니다. 실험 매핑 논문 질문| 방법| 범주| 로컬 디렉터리| 데이터셋...
benign-instruction-bench
훈련한 테스트를 통과하기 프롬프트 인젝션 탐지기를 LLM 에이전트가 실제로 사용하는 지점, 즉 에이전트가 읽는 도구 출력에서 재평가한다. 팀들은 벤치마크 점수로 인젝션 탐지기를 고른다. 우리는 그 점수가 에이전트 내부에서의 동작을 예측하는지 확인하고, 대체로 그 점수는 벤치마크가 탐지기의 훈련 데이터에 얼마나 가까운지를 측정한다는 것을 발견한다. 발견 사항 15개의 탐지기오픈 9개, Meta의 Prompt Guard 2를 포함한 라이선스 제한 6개와 2개의 작업 인식 LLM 판정자를, 두 개의 에이전트 벤치마크AgentDojo...
Xalgorix Autonomous AI Pentesting Agent 4.6.152
Most scanners detect. Xalgorix proves. An autonomous LLM agent works a full pentest methodology, then an independent verifier re-exploits every finding before it's reported - so you get proof, not a pile of maybes to triage. Self-hosted, private, and bring-your-own-LLM. Built in Go + TypeScript...
Newer and Bigger, but Safer? A Longitudinal Study of the Functionality-Security Gap in LLM-Generated Code
Large Language Models LLMs are widely used to generate code. Although their functional plausibility keeps improving, the generated code often contains security vulnerabilities. The functionality-security gap captures code that passes functional tests but fails security tests. A recent longitudina...
Learning from Failures: A Failure-Driven Prompt Refinement for LLM-Based Vulnerability Analysis
Large Language Models have emerged as promising tools for software vulnerability analysis, but their effectiveness depends heavily on prompt design. Existing research primarily compares prompting strategies using aggregate performance metrics, providing limited insight into why models fail or how...
HiTMS_steganography
HiTMS: 고처리량 다중 스트림 언어 스테가노그래피 프레임워크 LLM 채팅 대화에 대한 언어 스테가노그래피 연구 코드로, 단일 스트림 기준baseline과 배치 방식의 다중 스트림HiTMS 프로토콜을 포함합니다. 이 프로토콜은 여러 개의 독립적인 비밀 메시지를 한 번에 숨기고 GPU 배칭batching을 활용하여 훨씬 더 높은 처리량을 달성합니다. Bob 모델이 질문을 하고, Alice 모델이 대답하면서 스테가노그래픽 코더steganographic coder를 통해 페이로드를 토큰 선택에 비밀리에 인코딩합니다. Bob은...
xalgorix
Xalgorix — Open-source AI pentester that proves vulnerabilities Most scanners detect. Xalgorix proves. An autonomous LLM agent works a full pentest methodology, then an independent verifier re-exploits every finding before it's reported — so you get proof, not a pile of maybes to triage...
OpenHunterAI
OpenHunterAI 당신의 로컬 AI 레드팀. 웹, API, LLM 애플리케이션 보안을 위한 공격자 관점의 추론. 빠른 시작 · 에이전트 스킬 · 평가 모델 · 아키텍처 · 문서 · 스타 히스토리 OpenHunterAI는 범위, 스캔 활동, 발견 사항, 그리고 교정을 하나의 로컬 워크스페이스로 통합합니다. 계정 없이 시작하고, 모델 제공자를 연결한 뒤, 소유하거나 테스트 권한을 부여받은 검증된 공개 애플리케이션 을 평가하세요. 기능| 제공 내용 ---|--- 로컬 워크스페이스| 가입 불필요; 프로젝트와 스캔 기록이 로컬...
recipe-blog-encoding
recipe-blog-encoding !WARNING 이 프로젝트는 전적으로 vibe-coding 으로 작성되었으며 아마도 이 저장소에서 부분적으로 표절되었습니다, 작성자는 아이디어가 재미있다고 생각한 바보입니다. SEO 게임 레시피 서문을 사용하여 비밀 메시지를 인코딩하는 도구입니다 사실 프롬프트는 무엇이든 될 수 있으며, 공유 프롬프트는 인코더와 디코더가 동의하는 키일 뿐입니다. 신경 언어 스테가노그래피를 사용하여 자연스러운 텍스트에 비밀 메시지를 숨깁니다. 작동 방식 1. 인코더는 비밀 메시지와 공유 프롬프트를 받습니다...