该研究使用了哪些大语言模型?
该研究使用了GPT-4.1和GPT-5.0两个大语言模型。
(翻译)利用大型语言模型进行疾病传播模型的系统性文献综述
Abstract page for arXiv paper 2608.26150: Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models
该研究利用GPT-4.1和GPT-5.0等大语言模型构建自动化流水线,从536篇同行评审的基于代理建模论文中提取模型相关信息,并与人工系统性文献综述结果对比。结果显示,论文级准确率分别约为77.95%和81.67%,但字段级准确率差异大,复杂或主观字段表现不稳定。研究还发现,大语言模型间的一致性是输出质量的潜在指标,低一致性可能提示幻觉,高一致性但低准确率可能反映人工数据集的噪声或错误。
该研究使用了GPT-4.1和GPT-5.0两个大语言模型。
论文级准确率分别约为77.95%和81.67%,字段级准确率范围为32.40%至100%,复杂或主观字段可靠性较低;LLM间一致性可作为质量指标,低一致性可能提示幻觉,高一致性低准确率可能反映人工数据集噪声。
用于系统性文献综述,从536篇基于代理建模论文中提取模型相关信息,以评估大语言模型在自动化文献综述中的潜力与局限。
语义翻译的操作日常:把”我觉得不对”变成”机器能查”PS2 Fat 使用的安全芯片在时隔 26 年被破解
从 270 分钟到 18 分钟:B 端产品经理如何主导一个 AI 达人撮合系统
关于项目交付的思考:部署是最后两公里,验收才是最后一公里
黄仁勋再谈AI危险论:中国会成为全球开源重要力量
基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
自主团队被捧过头了?Simon Rohrer 直言:你们交付的根本不是产品
号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾
旗舰SoC进入融合计算时代,天玑9600 Pro首创AI原生架构!
iPhone 18 Pro & Duo 首发评测,提升最大的是「充电」和这个…夜晚睡眠光照太亮可能会损伤心脏
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源
耐克、妮维雅、谷歌的警示:品类,正在误导品牌战略!
渣打给ARB十美元目标价靠什么?
清晰法案有概率通过?市场可能并未定价F-Droid 上的应用有多少是在 AI 帮助下编写的?
长期利率为何不愿下跌?一款在浏览器里运行、部署在自己服务器上的 SQL 客户端
OpenAI万亿IPO推迟背后 四本账与三条投资路径
派早报:豆包发布手机助手消费者版,绿联发布首款雷电 5 显卡坞等Steam Frame 起售价 1059 美元
一边喊停一边敲钟:硅谷AI巨头到底在怕什么36氪项目新势榜:不看包装,只看项目真实进展
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降
AI不断进步 不得不把才华埋葬在昨天
美联储今起议息 沃什或成关键一票
分析师:四大关键因素驱动 Robinhood 链快速增长