Artificial Analysisは、Intelligence Indexのアップデート版であるv4.2をリリースしたと発表しました。今回の更新により、指標はより現実世界のユースケースに近い、複雑で難易度の高いタスクに対応しています。

新たな評価項目として、エージェント的な知識作業を測定する「AA-Briefcase」が追加されました。これは、業界の専門家が構築した複雑なプロジェクトを通じて、モデルの総合的なエージェント能力を評価するものです。また、4,592ページに及ぶ大量のPDFから情報を合成する「GDP.pdf」も新たに導入されました。

評価の信頼性を高めるための変更も実施されています。指標のウェイトのうち、40%を非公開のテストセットが占めるようになり、これはv4.1の2倍に相当します。これにより、開発側による評価の操作(ゲーミング)を防ぐとしています。

最新のランキングでは、AnthropicのClaude Fable 5.1が首位となりました。次いでOpenAIのGPT-6 Astraが続きます。Metaは3番手となっており、SpaceXAIやMoonshot/Kimiなどがそれに続く形です。

出力トークンの効率性においては、GPT-6 Astraがインテリジェンスの最前線にある他のモデルと比較して、高いトークン効率を示していると報告されています。


出典: Artificial Analysis Intelligence Index v4.2(Hacker News Frontpage、2026-09-05)