OpenAIの「AGI到達」宣言に待った! 評価テスト「99.9%」のカラクリと評価団体が反論した真実

AI評価の焦点は「その思考力は、答えのない現実世界の課題にどこまで通用するのか」という汎用性を問うフェーズへと移行している