BenchMIRT 是什么?
BenchMIRT 是 AI2 推出的一种新方法,用于在单个提示层面审计 LLM 基准测试,通过多维项目反应理论(MIRT)估计模型在安全、通用推理等不同能力上的表现,并分析每个问题主要测量的能力。
(翻译)BenchMIRT:LLM 基准测试究竟在测量什么?

A Blog post by Ai2 on Hugging Face
AI2 推出 BenchMIRT,一种基于多维项目反应理论的新方法,可在单个提示层面审计 LLM 基准测试。研究对 100 个开源模型、16 个基准和超过 3.4 万个问题进行分析,识别出安全与通用推理两个主导维度,并揭示 BBQ、WMDP 等基准实际测量的能力可能与预期不同。
BenchMIRT 是 AI2 推出的一种新方法,用于在单个提示层面审计 LLM 基准测试,通过多维项目反应理论(MIRT)估计模型在安全、通用推理等不同能力上的表现,并分析每个问题主要测量的能力。
它从 16 个基准、100 个模型中独立恢复出安全和通用推理两个主导维度,并发现 BBQ、WMDP 等部分基准的得分更多关联通用推理而非安全,HarmBench 中的不同类型问题也可能测量不同能力。
它可以帮助识别基准中信息量最大的问题,仅用 10% 的问题即可近似保留完整基准对模型能力的评估,还能预测模型在未见过的题目上的表现,准确率达到 79%。
微信桌面端变“三折叠”,可能是在给小微腾位置
Agent开始调用基础设施,Kubernetes准备好了吗?圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
别闹,几粒盐就能立起高脚杯?你是不是用胶水了?
飞书与豆包工作合体后首亮相:Agent 能进群,还能帮你写周报、做PPT
找不到小红书爆文选题?去淘宝差评区抄!
美股太贵 该加仓新兴市场吗?
百度做了一堆AI产品,却没有一个能代表百度?
Arc主网上线 生态内有哪些项目?36氪首发 | 国内头部硅电容IDM企业融资亿元,切入AI芯片与高端光模块
Grayscale:比特币能否优化私募市场投资组合?
AI风口之下,明星们又想“挤上”牌桌了
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚量子位2026人工智能年度榜单,正式启动!廉价太阳能改变世界能源格局
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
清晰法案有概率通过?市场可能并未定价
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA一款在浏览器里运行、部署在自己服务器上的 SQL 客户端
在金融支付系统中实施混沌工程:来自企业级 ECS 部署的经验教训
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级英国殖民之前的澳大利亚原居民人口约 222 万
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首F-Droid 上的应用有多少是在 AI 帮助下编写的?
GPT Image 2.5 对比实测:变化与局限