GPS-Bench中的Gold集和Silver集有什么区别?
Gold集由人工根据真实记录标注,用于模型评测;Silver集由另一个LLM从检索证据中标注,仅作为监督信号用于训练,不作为测试标签。
(翻译)GPS-Bench:一个用于自动化政策分析的治理政策基准
Abstract page for arXiv paper 2609.03553: GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis
论文提出GPS-Bench,一个基于证据的治理政策模拟基准。它利用立法记录、游说披露、监管文件、公司财报等公共证据,将政策与相关行动者、行动和下游影响联系起来,并通过人工标注(Gold)与另一LLM标注(Silver)区分评测与训练数据。研究对比多种推理模式,发现基于真实记录微调的模型在行动者层面预测最强,分解方法虽未提升预测但提供机制解释。
Gold集由人工根据真实记录标注,用于模型评测;Silver集由另一个LLM从检索证据中标注,仅作为监督信号用于训练,不作为测试标签。
在真实治理记录上微调模型在行动者层面的影响预测上表现最强,多智能体分解方法未能在预测精度上超越微调,但可提供机制解释,例如联盟如何形成。
找不到小红书爆文选题?去淘宝差评区抄!
黄仁勋再谈AI危险论:中国会成为全球开源重要力量企业案例分享:坤煜量子|36氪2026产业未来大会
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源
耐克和lululemon双双失速,运动品牌进入碎片化时代
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code高性能电动船艇动力系统公司获近亿A轮融资,海外收入增长450%丨36氪首发
HIP-3:昂贵的入场券 买不来的护城河圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
贝森特回购落空与通胀重压 美联储加息或全面开启8点1氪丨选手赛中失禁污染赛道,HYROX中国宣布整改;机构预计美股明年将暴跌21%;苹果推出Siri人工智能
CoinEx宣布体面关停:值得肯定但不该神化
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
上市前交易市场:永续合约化的Pre-IPO资产
豆包工作打出“团队Agent”牌,Workbuddy、千问会跟吗?
企业该买模型还是养上下文?
从入门到精通,一篇文章带你入门产品经理!(2026 年最新版)NVIDIA中国开发者日定档10月苏州,现场设认证考试与黑客松决赛
从担心AI失控 到AI造福人类:比尔盖茨怎么想
美股太贵 该加仓新兴市场吗?
OpenAI万亿IPO推迟背后 四本账与三条投资路径
川普让步了 为何Clarity法案还遭到全体民主党人反对
“裁判”不想给阿莫迪吹暂停
以太坊 2026 年第二季度报告
社区速递 158 | 便宜耐造的副厂手柄与大学宿舍里那些相见恨晚的装备
电商对账的设计逻辑:四层核对,逐层下钻
CLARITY闯关失败 加密市场闻声而动 政策空白谁填补
早报|雷军同日到访宇树与B站/罗永浩差评带来流量,野人先生单日涨粉近3万/鸿蒙智行确认问界合作调整,赛力斯主导
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降