该模型在多少条Jeopardy!题目上进行了测试?
529,939条,覆盖1984至2025年全部41季。
(翻译)可检验人类知识的时间胶囊:单一免费本地模型中的41年Jeopardy!
Abstract page for arXiv paper 2608.27459: Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
论文评估了一个9GB开源模型(Qwen2.5-14B 4bit)在529,939条Jeopardy!题目上的表现,涵盖1984至2025年全部41季。模型在严格强制回答协议下准确率为67%,事实类题目超过85%;在训练截止后播出的题目上保持65%,而IBM Watson为0。研究认为知识快照已可便携且几乎免费。
529,939条,覆盖1984至2025年全部41季。
65%,而Claude Opus 4.8为95%,Watson为0。
Qwen2.5-14B的4-bit量化版本,约9GB。
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成RustSDL3 移植到 HarmonyOS / OpenHarmony
具透 | 精心优化, 体验感愉悦升华:iOS 27 中值得关注的新特性
YC 最值钱的这 20家公司,没有一家来自最近5年
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
电商对账的设计逻辑:四层核对,逐层下钻
字节跳动CEO梁汝波:豆包、飞书与火山引擎整合后 将加大企业市场投入
被用了几千年的铜,怎么突然成了AI时代的新宠?36氪首发 | 国内头部硅电容IDM企业融资亿元,切入AI芯片与高端光模块
英伟达开始限制Claude使用了圆桌:CVC的全面崛起 | 36氪 2026产业未来大会
以太坊 2026 年第二季度报告
当罗永浩站在群众的对立面
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
Opus 5.2深夜上线 RSI真来了?
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
一边喊停一边敲钟:硅谷AI巨头到底在怕什么
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下圆桌:落地·量子计算的场景涌现——如果量子算力明天就可用,谁会第一个买单 | 36氪 2026产业未来大会企业案例分享:坤煜量子|36氪2026产业未来大会
我和我的 AI 手机吃了 3 顿饭
CLARITY的失败 跟加密行业好坏没啥关系
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台Announcing instance preference lists for Amazon SageMaker AI training jobs