通义千问: 📢Qwen3.7-Max just hit #3 on ITbench-AA — a…
📢Qwen3.7-Max just hit #3 on ITbench-AA — a fresh benchmark testing how well models handle real-wor…
查看原文TL;DR · 评测解读
Qwen3.7-Max 在新晋 ITbench-AA 评测中拿下第三名,但该 benchmark 透明度极低——缺乏公开评分标准、参评模型数量和具体分数差距,厂商"报喜"式传播存在 cherry-picking 风险,实际参考价值存疑。
深度解读
测什么:ITbench-AA 的定位存疑
ITbench-AA 名称暗示是面向 Agent(智能体)场景的 IT 任务评测,但目前公开信息极为有限。从常识推断,该 benchmark 应覆盖代码执行、工具调用、自动化工作流等场景——这也是 2026 年主流模型评测的标配方向。然而,benchmark 的具体任务集、评分维度和数据来源均未披露,外界无法判断其与真实 Agent 使用场景的贴合程度。
更关键的是,该 benchmark 尚未建立行业公信力。相比 SWE-bench(代码任务)、AgentBench(综合 Agent 评估)等有学术背书的评测,ITbench-AA 的第三方验证缺失,使其更像是一个厂商主导的定制化测试场。
方法论质疑
- Cherry-picking 风险极高:阿里仅选择性公布对自己有利的排名结果(#3),未披露总参评数量、第一名分数、第二名差距。这意味着 Qwen3.7-Max 可能在一百个模型中排第三,也可能只是前五中的吊车尾,差距可能是 0.1 分也可能是 10 分。
- Contamination 不可排除:如果 ITbench-AA 数据规模有限,模
● 未登录访客SMARTFLOW PRO
继续阅读深度解读 + 编辑加注
下方还有 3-5 段深度分析 + Vincent 编辑加注 + 可点击信源,仅 Pro 会员可见
加入机智流 PRO →¥99 / 季 · 每周 1 篇深度研报 · 飞书+微信群双通道
已是 Pro 但仍被提示?联系反馈
参考来源
- Qwen3.7-Max ITbench-AA 第三名公告 · 2026-05-28
- AgentBench: A Benchmark for Agents · 2023-08-01
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 2022-10-01
本解读由 AI 自动生成 · 模板:评测解读 · 仅供参考,请以原文为准。