Fuel To The Fire: How effective are LLM-based safety filters for AI systems?
1–2 of 2 posts
Re: Fuel To The Fire: How effective are LLM-based safety filters for AI systems?
#2These vulnerabilities are now documented in the LVE Repository: https://lve-project.org/trust/guards/suffix_attack/hf-meta--...