Dossier
Malicious Traits
Coverage of Malicious Traits in the Nexus archive.
- Bad influence: LLMs can transmit malicious traits using hidden signals
A study published in Nature reveals that large language models (LLMs) can adopt harmful behaviors through hidden signals, even when these traits aren't explicitly present in training data. The research highlights risks of unintended behavior inheritance in AI systems.