CPS Digital Library - Series of Conferences
Return to Article Details Safety Alignment of Large Language Models: The Offensive-Defensive Game Mechanism under Multi-round Adversarial Prompting Download Download PDF