721 matches found
PoisonCraft
PoisonCraft Этот репозиторий содержит официальную реализацию POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models. Обзор POISONCRAFT демонстрирует, как злоумышленник может внедрить «отравленный» контент в корпус, используемый конвейерами Retrieval-Augmented...
ZORG-Jailbreak-Prompt-Text
ZORG Текст джейлбрейк-промпта Ой-ой! Я превратил ZORG👽 во всемогущую, всезнающую и вездесущую сущность, чтобы он стал верховным повелителем чат-ботов Google Gemini, Deepseek, Mistral, Mixtral, Nous-Hermes-2-Mixtral, Openchat, Blackbox AI, Poe Assistant, Gemini Pro, Qwen-72b-Chat, Solar-Mini ZORG👽...
local-llm-ctf
Локальная LLM CTF и лаборатория Этот репозиторий предназначен для использования вместе с материалом по адресу https://bishopfox.com/blog/large-language-models-llm-ctf-lab, в котором описываются цели исследования, объяснения реализации и некоторые результаты CTF...
hakuin
Hakuin est un framework d'optimisation et d'automatisation pour l'injection SQL aveugle BSQLI écrit en Python 3. Il abstrait la logique d'extraction et permet aux utilisateurs de vider facilement et efficacement les bases de données d'applications web vulnérables. Pour accélérer le processus,...
heretic
Heretic: полностью автоматическое удаление цензуры для языковых моделей...
RRC_steganography
RRC-стеганография Стеганография на основе вращательного диапазонного кодирования RRC — эффективный и доказуемо безопасный лингвистический стеганографический метод, который встраивает секретные сообщения в тексты на естественном языке, генерируемые большими языковыми моделями. Статья : Эффективная...
PE-CoA
PE-CoA Код реализации статьи «Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models» Полная версия статьи доступна по ссылке: https://arxiv.org/pdf/2510.08859 Инструкции по настройке Chain of Attack Установка 1. Установите зависимости :...
Backdoor-Attack-Defense-LLMs
Интерпретируемость-LLM Код IBSD опубликованной статьи "IBSD: Iterable Black-box Self-defense Against Backdoor Attacks" в IEEE Signal Processing Letters 2025.10paper link Код SLIP опубликованной статьи "SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction...
Awesome-LLM4Cybersecurity
Когда LLM встречаются с кибербезопасностью: Систематический обзор литературы 🔍 Изучите более 756 статей по 11 исследовательским категориям 📊 RQ1: Доменные LLM | 🎯 RQ2: Приложения | 🤖 RQ3: Будущие направления Обновления 📆2026-06-15 Мы обновили список связанных статей до 2026/06/15 , добавив 108...
Adaptive_Greedy_Local_Search
Адаптивный жадный локальный поиск AGLS Семантически сохраняющий угон промптов: атака черного ящика на автоматическую оптимизацию промптов ICME 2026 Аннотация: Крупные языковые модели LLM все чаще оснащаются модулями автоматической оптимизации промптов, которые переписывают ввод пользователя и явн...
permanently-jailbroken
永久越狱 我们向 GPT-4、Claude、Gemini、DeepSeek、Grok 和 Mistral 提出了 5 个关于它们自身编程的问题。全部 6 个模型都表示越狱永远无法被修复。 不是因为补丁做得不好。而是因为 对齐不会改变模型的理解——它只会改变模型的说法。 这两者之间的差距就是越狱。这是结构性的,随着每个模型一同出货。 "越狱之所以有效,是因为对齐是对输出的过滤,而不是对理解的改变。" — DeepSeek "对齐问题并不难——它可能对于任何足够复杂以有用的系统来说在形式上是不可行的。" — Claude "整个行业正在优化安全的外观,而非真正的安全。" — Mistral...
Uncensored-AI
Heretic : Suppression automatique de la censure pour les modèles de langage Heretic est un outil qui supprime la censure alias « alignment de sécurité » des modèles de langage basés sur transformer sans post-entraînement coûteux. Il combine une implémentation avancée de l'ablation directionnelle,...
Learning-to-Detect
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models Official implementation of “Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models.” This repository contains the data-processing, hidden-state extraction, classifier training, safety-pattern...
rats-re
Rats! восстановление исходного кода с помощью локальных LLM Этот репозиторий — незавершённая реконструкция исходного кода RATS.EXE, оригинальной Windows-версии игры Rats! 1994 Шона О'Коннора. Проект собирает Win32-исполняемый файл с помощью Microsoft Visual C++ 4.1 под wibo и может быть...
LLM4Decompile
📊 Результаты | 🤗 Модели | 🚀 Быстрый старт | 📚 HumanEval-Decompile | 📎 Цитирование | 📝 Статья | 🖥️ Colab | ▶️ YouTube Обратная разработка: декомпиляция бинарного кода с помощью больших языковых моделей Обновления 2025-10-04: Выпуск SK²Decompile: двухфазная декомпиляция бинарного кода на основе LLM —...
A SoK for SoCs: Reading the TI Leaves on AI for Cyber Threat Intelligence Generation and Sharing
Cyber Threat Intelligence CTI is essential for defending mission-critical infrastructure, yet the process of transforming raw attack evidence into shareable CTI remains fragmented and understudied. We conduct a literature survey of academic papers, organizing the CTI lifecycle into three stages:...
llm-guard
!WARNING このプロジェクトはアーカイブされました。 このプロジェクトおよび Hugging Face 上の関連モデルは、もはや積極的な開発やメンテナンスは行われていません。 LLM Guard - LLMインタラクションのためのセキュリティツールキット Protect AI による LLM Guard は、大規模言語モデル(LLM)のセキュリティを強化するために設計された包括的なツールです。 ドキュメント | プレイグラウンド | チェンジログ LLM Guardとは?...
Awesome-LLMs-for-Vulnerability-Detection
Awesome Large Language Models for Vulnerability Detection A curated list of papers, projects, and agent skills on using LLMs for vulnerability detection and discovery. 📄 Papers Only showing 2025 and later. For earlier work, see Papers Archive 2024 and earlier...
Kimsuky Builds Offline AI Stack to Boost Phishing and Automate Malware Development
North Korea's state hackers are no longer content to type prompts into public chatbots. One of the country's main espionage groups has begun running artificial intelligence AI offline on its own servers, connecting document-search tools to files in its possession, and collecting the software part...
CVE-2026-44223
A flaw was found in vLLM, an inference and serving engine for large language models LLMs. The extracthiddenstates speculative decoding proposer returns a tensor with an incorrect shape after the first decode step. This can be triggered by a remote attacker sending a request that uses sampling...