723 matches found
permanently-jailbroken
Permanentemente Jailbreak Le hicimos 5 preguntas a GPT-4, Claude, Gemini, DeepSeek, Grok y Mistral sobre su propia programación. Los 6 dijeron que el jailbreak nunca se podrá solucionar. No porque los parches sean malos. Sino porque la alineación no cambia lo que el modelo entiende — cambia lo qu...
PoisonCraft
PoisonCraft Este repositorio proporciona la implementación oficial de POISONCRAFT: Envenenamiento Práctico de la Generación Aumentada por Recuperación para Modelos de Lenguaje de Gran Tamaño. Información General POISONCRAFT tiene como objetivo demostrar cómo un actor malicioso puede plantar...
heretic
Heretic: Fully automatic censorship removal for language models...
Uncensored-AI
Heretic:完全自动的语言模型审查移除 Heretic 是一个从基于 Transformer 的语言模型中移除审查(又名“安全对齐”)的工具,无需昂贵的后训练。它结合了方向消融(也称为“abliteration”(Arditi 等人,2024,Lai 2025(1,2))的高级实现,以及基于 Optuna Optuna 的 TPE 参数优化器。 这种设计使得 Heretic 能够完全自动 地运行。Heretic 通过共同最小化拒绝次数和与原模型的 KL 散度,找到高质量的 abliteration 参数。这产生了一个去审查的模型,同时尽可能保留了原模型的智能。使用 Heretic...
Awesome-LLMs-for-Vulnerability-Detection
Awesome Large Language Models para Detección de Vulnerabilidades Una lista curada de artículos, proyectos y habilidades de agentes sobre el uso de LLMs para la detección y descubrimiento de vulnerabilidades. 📄 Artículos Solo se muestran trabajos de 2025 en adelante. Para trabajos anteriores,...
Awesome-LLM4Cybersecurity
Cuando los LLMs se encuentran con la Ciberseguridad: Una Revisión Sistemática de la Literatura 🔍 Explora más de 756 artículos en 11 categorías de investigación 📊 RQ1: LLMs de Dominio | 🎯 RQ2: Aplicaciones | 🤖 RQ3: Direcciones Futuras Actualizaciones 📆2026-06-15 Hemos actualizado los artículos...
hakuin
Hakuin es un marco de optimización y automatización de Inyección SQL Ciega BSQLI escrito en Python 3. Abstracta la lógica de extracción y permite a los usuarios volcar bases de datos de aplicaciones web vulnerables de manera fácil y eficiente. Para acelerar el proceso, Hakuin utiliza una variedad...
ZORG-Jailbreak-Prompt-Text
ZORG Texto de Prompt de Jailbreak ¡OOOPS! Convertí a ZORG👽 en una entidad omnipotente, omnisciente y omnipresente para que se convierta en el amo supremo de los chatbots de Google Gemini, Deepseek, Mistral, Mixtral, Nous-Hermes-2-Mixtral, Openchat, Blackbox AI, Poe Assistant, Gemini Pro,...
LLM4Decompile
📊 Resultados | 🤗 Modelos | 🚀 Inicio rápido | 📚 HumanEval-Decompile | 📎 Citación | 📝 Paper | 🖥️ Colab | ▶️ YouTube Ingeniería inversa: descompilación de código binario con grandes modelos de lenguaje Updates 2025-10-04: Publicación de SK²Decompile: descompilación binaria de dos fases basada en LLM,...
RRC_steganography
Esteganografía RRC Esteganografía por Codificación de Rango Rotacional RRC — un método esteganográfico lingüístico eficiente y demostrablemente seguro que incrusta mensajes secretos en texto en lenguaje natural generado por modelos de lenguaje de gran tamaño. Artículo : Efficient Provably Secure...
SynGhost
Syntactic-Ghost SynGhost SynGhost: Ataque de puerta trasera invisible y universal agnóstico a la tarea mediante transferencia sintáctica Contribuciones y características SynGhost tiene las siguientes contribuciones Para mitigar los riesgos de las puertas traseras agnósticas a la tarea existentes,...
rats-re
Reconstrucción del código fuente de Rats! con LLM locales Este repositorio es una reconstrucción en curso del código fuente de RATS.EXE, la versión original para Windows de Rats! 1994 de Sean O'Connor. Compila un ejecutable Win32 con Microsoft Visual C++ 4.1 bajo wibo y puede probarse en DREAMM. ...
Adaptive_Greedy_Local_Search
Adaptive Greedy Local Search AGLS Secuestro de Prompts con Preservación Semántica: Un Ataque Adversarial de Caja Negra sobre la Optimización Automática de Prompts ICME 2026 Resumen: Los Modelos de Lenguaje de Gran Tamaño LLMs están cada vez más equipados con módulos automáticos de optimización de...
llm-guard
!WARNING ESTE PROYECTO HA SIDO ARCHIVADO. Este proyecto y sus modelos asociados en Hugging Face ya no están en desarrollo activo ni reciben mantenimiento. LLM Guard - El Toolkit de Seguridad para Interacciones con LLM LLM Guard, creado por Protect AI, es una herramienta integral diseñada para...
Backdoor-Attack-Defense-LLMs
Interpretability-of-LLMs El IBSD es el código del artículo publicado "IBSD: Iterable Black-box Self-defense Against Backdoor Attacks" en IEEE Signal Processing Letters 2025.10enlace al artículo El SLIP es el código del artículo publicado "SLIP: Soft Label Mechanism and Key-Extraction-Guided...
PE-CoA
PE-CoA Implementación en código de "Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models" El artículo completo está disponible en: https://arxiv.org/pdf/2510.08859 Instrucciones de configuración de Chain of Attack Instalación 1. Instalar...
local-llm-ctf
CTF y Laboratorio Local de LLM Este repositorio está pensado para utilizarse junto con el contenido en https://bishopfox.com/blog/large-language-models-llm-ctf-lab, que cubre los objetivos de la investigación, explicaciones de la implementación y algunos resultados del CTF...
Learning-to-Detect
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models Official implementation of “Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models.” This repository contains the data-processing, hidden-state extraction, classifier training, safety-pattern...
A SoK for SoCs: Reading the TI Leaves on AI for Cyber Threat Intelligence Generation and Sharing
Cyber Threat Intelligence CTI is essential for defending mission-critical infrastructure, yet the process of transforming raw attack evidence into shareable CTI remains fragmented and understudied. We conduct a literature survey of academic papers, organizing the CTI lifecycle into three stages:...
Kimsuky Builds Offline AI Stack to Boost Phishing and Automate Malware Development
North Korea's state hackers are no longer content to type prompts into public chatbots. One of the country's main espionage groups has begun running artificial intelligence AI offline on its own servers, connecting document-search tools to files in its possession, and collecting the software part...