OpenAI被曝多次修改GPT-6 Astra基准测试数据
据Fortune报道,OpenAI在发布GPT-6 Astra后多次修改基准测试数据,部分成绩大幅变化。
大家主要在讨论
- 成绩调整是修正还是刷榜
- 评测方法透明度为何低
- 对竞品模型成绩是否公平
- 最高分口径是否误导用户
还没人说清的是缺少第三方独立复测及对OpenAI内部评测流程的审计。
为什么上榜AI基准测试的公信力直接影响行业比较与用户选择,争议或削弱对OpenAI性能宣传的信任。
查看话题时间线 · 1 次更新 →