Companies are optimizing models for specific benchmarks #1 Post by mzubairtahir » Sat, Jul 25, 2026, 5:34 AM UTC Openai is optimizing for gpqa diamond and anthropic is optimizing for humanity last exam. gpt 5.6 wins on gpqa and opus 5 wins on humanity last exam