In March, OpenAI’s GPT-5.4 achieved a new state-of-the-art, matching or exceeding industry professionals in 83.0% of comparisons on GDPval, a benchmark spanning 44 occupations. In February, Anthropic’s Claude Opus 4.6 signaled a similar advance, pairing that performance with stronger coding, better debugging, and longer task execution for agents....