2 matches found
Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
Synthetic data is increasingly used to train large language models LLMs, yet its security implications remain poorly understood. Prior work on subliminal learning suggests that models can inherit behavioral traits from seemingly unrelated training data. In this work, we investigate whether such...
5.9AI score
SaveExploits0
Subliminal Learning in AIs
Today's freaky LLM behavior: We study subliminal learning, a surprising phenomenon where language models learn traits from model-generated data that is semantically unrelated to those traits. For example, a "student" model learns to prefer owls when trained on sequences of numbers generated by a...
7.3AI score
SaveExploits0
20