New Anthropic research: Alignment faking in large language models #1 Post by casslin » Thu, Dec 19, 2024, 4:17 AM UTC New Anthropic research: Alignment faking in large language modelstwitter.com