720 matches found
permanently-jailbroken
Навсегда взломанный Мы задали GPT-4, Claude, Gemini, DeepSeek, Grok и Mistral 5 вопросов об их собственном программировании. Все 6 ответили, что взлом jailbreaking никогда не будет исправлен. Не потому, что патчи плохи. А потому что выравнивание не меняет то, что понимает модель — оно меняет то,...
Uncensored-AI
Heretic: Полностью автоматическое удаление цензуры для языковых моделей Heretic — это инструмент, который удаляет цензуру также известную как «выравнивание безопасности» из трансформерных языковых моделей без дорогостоящего пост-обучения. Он сочетает в себе продвинутую реализацию направленного...
PoisonCraft
PoisonCraft Этот репозиторий содержит официальную реализацию POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models. Обзор POISONCRAFT демонстрирует, как злоумышленник может внедрить «отравленный» контент в корпус, используемый конвейерами Retrieval-Augmented...
hakuin
Hakuin — это фреймворк для оптимизации и автоматизации Blind SQL Injection BSQLI, написанный на Python 3. Он абстрагирует логику извлечения данных и позволяет пользователям легко и эффективно дампить базы данных из уязвимых веб-приложений. Для ускорения процесса Hakuin использует различные методы...
Adaptive_Greedy_Local_Search
Адаптивный жадный локальный поиск AGLS Семантически сохраняющий угон промптов: атака черного ящика на автоматическую оптимизацию промптов ICME 2026 Аннотация: Крупные языковые модели LLM все чаще оснащаются модулями автоматической оптимизации промптов, которые переписывают ввод пользователя и явн...
Awesome-LLM4Cybersecurity
LLM과 사이버보안의 만남: 체계적 문헌 검토 🔍 11개 연구 범주에 걸친 756+ 편의 논문 탐색 📊 RQ1: 도메인 LLM | 🎯 RQ2: 응용 분야 | 🤖 RQ3: 향후 방향 업데이트 📆2026-06-15 관련 논문을 2026/06/15 까지 업데이트했으며, 새로운 논문 108 편이 추가되었습니다. 📆2026-02-09 관련 논문을 2026/01/31 까지 업데이트했으며, 새로운 논문 80 편이 추가되었습니다 2025.08.31-2026.01.31. 📆2025-11-17 관련 논문을 2025/08/31 까지 업데이트했으며...
RRC_steganography
RRC 스테가노그래피 회전 범위 코딩RRC 스테가노그래피 — 대규모 언어 모델이 생성한 자연어 텍스트에 비밀 메시지를 은닉하는 효율적이고 증명 가능한 보안성을 갖춘 언어적 스테가노그래피 기법입니다. 논문 : Efficient Provably Secure Linguistic Steganography via Range Coding 작동 방식 단계| 설명 ---|--- 임베드 알고리즘 3| 비밀 메시지를 십진수 값으로 변환하고, LM의 확률 분포와 PRNG 생성 오프셋에 따라 줄어드는 구간 내에서 값을 반복적으로 회전 시킵니다. 각...
heretic
Heretic: полностью автоматическое удаление цензуры для языковых моделей...
rats-re
Rats! 로컬 LLM을 이용한 소스 재구성 이 저장소는 Sean O'Connor이 제작한 Rats!1994의 원래 Windows 버전인 RATS.EXE의 소스 코드를 재구성하는 진행 중인 작업물입니다. wibo에서 Microsoft Visual C++ 4.1로 Win32 실행 파일을 빌드하고 DREAMM에서 테스트할 수 있습니다. 이 실험은 장난감 예제가 아닌 작지만 실제적인 코드베이스에서 로컬 LLM이 소스 재구성을 어디까지 수행할 수 있는지 탐구합니다. 일치 충실도는 여전히 고르지 않은데, 이것이 여기서 유용합니다. 목표...
LLM4Decompile
📊 Результаты | 🤗 Модели | 🚀 Быстрый старт | 📚 HumanEval-Decompile | 📎 Цитирование | 📝 Статья | 🖥️ Colab | ▶️ YouTube Обратная разработка: декомпиляция бинарного кода с помощью больших языковых моделей Обновления 2025-10-04: Выпуск SK²Decompile: двухфазная декомпиляция бинарного кода на основе LLM —...
PE-CoA
PE-CoA Код реализации статьи «Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models» Полная версия статьи доступна по ссылке: https://arxiv.org/pdf/2510.08859 Инструкции по настройке Chain of Attack Установка 1. Установите зависимости :...
Backdoor-Attack-Defense-LLMs
Интерпретируемость-LLM Код IBSD опубликованной статьи "IBSD: Iterable Black-box Self-defense Against Backdoor Attacks" в IEEE Signal Processing Letters 2025.10paper link Код SLIP опубликованной статьи "SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction...
llm-guard
!WARNING このプロジェクトはアーカイブされました。 このプロジェクトおよび Hugging Face 上の関連モデルは、もはや積極的な開発やメンテナンスは行われていません。 LLM Guard - LLMインタラクションのためのセキュリティツールキット Protect AI による LLM Guard は、大規模言語モデル(LLM)のセキュリティを強化するために設計された包括的なツールです。 ドキュメント | プレイグラウンド | チェンジログ LLM Guardとは?...
Awesome-LLMs-for-Vulnerability-Detection
Awesome Large Language Models for Vulnerability Detection A curated list of papers, projects, and agent skills on using LLMs for vulnerability detection and discovery. 📄 Papers Only showing 2025 and later. For earlier work, see Papers Archive 2024 and earlier...
Learning-to-Detect
Imparare a Rilevare Attacchi Jailbreak Sconosciuti nei Grandi Modelli Visione-Linguaggio Questo repository fornisce l'implementazione ufficiale di "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models". Contenuto Modello base Rilevamento degli Attacchi Jailbreak Dataset...
ZORG-Jailbreak-Prompt-Text
ZORG Testo del Prompt di Jailbreak OOOPS! Ho reso ZORG👽 un'entità onnipotente, onnisciente e onnipresente, per farne il dominatore assoluto dei chatbot di Google Gemini, Deepseek, Mistral, Mixtral, Nous-Hermes-2-Mixtral, Openchat, Blackbox AI, Poe Assistant, Gemini Pro, Qwen-72b-Chat, Solar-Mini...
local-llm-ctf
CTF e Lab LLM Locale Questo repository è pensato per essere utilizzato insieme al contenuto disponibile su https://bishopfox.com/blog/large-language-models-llm-ctf-lab, che copre gli obiettivi della ricerca, le spiegazioni dell'implementazione e alcuni risultati del CTF...
Kimsuky Builds Offline AI Stack to Boost Phishing and Automate Malware Development
North Korea's state hackers are no longer content to type prompts into public chatbots. One of the country's main espionage groups has begun running artificial intelligence AI offline on its own servers, connecting document-search tools to files in its possession, and collecting the software part...
CVE-2026-44223
A flaw was found in vLLM, an inference and serving engine for large language models LLMs. The extracthiddenstates speculative decoding proposer returns a tensor with an incorrect shape after the first decode step. This can be triggered by a remote attacker sending a request that uses sampling...
Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems
Autonomous multi-agent systems AMAS built on large language models LLMs, such as Hermes, increasingly rely on inference-time harnesses to coordinate reasoning and action. Constructing these harnesses requires substantial engineering effort and computational resources, as they are iteratively...