Claim◆Article · 31 words
The pelican benchmark's former correlation with actual model quality has broken down, since GLM-5.2's pelican outclasses those from GPT-5.6 and Claude Fable 5 despite GLM not being a frontier-class model.
Simon Willison · Simon Willison's Weblog