ChainCatcher 消息,据金十报道,OpenAI 的一名员工公开指责马斯克旗下的xAI公司,称其发布的最新 AI 模型 Grok3 的基准测试结果具有误导性。对此,xAI 的联合创始人伊戈尔・巴布什金(Igor Babushkin)则坚称公司并无不当。 xAI 的图表显示,Grok3 的两个版本——Grok3 Reasoning Beta 和 Grok3 mini Reasoning——在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。然而,OpenAI 的员工很快在 X 平台上指出,xAI的图表并未包含 o3-mini-high 在“cons@64”条件下的 AIME 2025 得分。 巴布什金在 X 平台上辩称,OpenAI 过去也曾发布过类似的误导性基准测试图表。尽管这些图表是用于比较其自身模型的表现。
12.1万 热度
3.1万 热度
1.8万 热度
17.1万 热度
2801 热度
OpenAI 员工公开指责 xAI 最新 AI 模型 Grok3 的基准测试结果具有误导性
ChainCatcher 消息,据金十报道,OpenAI 的一名员工公开指责马斯克旗下的xAI公司,称其发布的最新 AI 模型 Grok3 的基准测试结果具有误导性。对此,xAI 的联合创始人伊戈尔・巴布什金(Igor Babushkin)则坚称公司并无不当。 xAI 的图表显示,Grok3 的两个版本——Grok3 Reasoning Beta 和 Grok3 mini Reasoning——在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。然而,OpenAI 的员工很快在 X 平台上指出,xAI的图表并未包含 o3-mini-high 在“cons@64”条件下的 AIME 2025 得分。 巴布什金在 X 平台上辩称,OpenAI 过去也曾发布过类似的误导性基准测试图表。尽管这些图表是用于比较其自身模型的表现。