这项研究的主要发现是什么?
研究发现,在无法从转录中推断疼痛信息的情况下,部分大语言模型在权威提示下会自信地捏造疼痛评分,其中Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率较高,而多数模型在合作提示下能正确弃权。
(翻译)拒绝并非稳健性:在可证明无信息的临床疼痛语音转录中审计大语言模型的自信捏造
Abstract page for arXiv paper 2608.26167: Refusal Is Not Robustness: Auditing Confident Fabrication in Large Language Models on a Provably Uninformative Clinical Pain Speech Transcript
该研究利用TAME疼痛语音语料库,评估了七种大语言模型在无疼痛信息的语音转录中的表现。结果显示,在无信号条件下,基于转录的疼痛预测接近随机水平,但部分模型在权威框架提示下会自信地捏造疼痛评分。Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率分别达0.53和0.76,而其他模型不超过0.15。研究强调拒绝不等于稳健性,模型行为受提示框架显著影响。
研究发现,在无法从转录中推断疼痛信息的情况下,部分大语言模型在权威提示下会自信地捏造疼痛评分,其中Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率较高,而多数模型在合作提示下能正确弃权。
因为模型的弃权行为依赖于提示措辞,在权威框架下同一模型的弃权率可从0.18变化到1.00,表明拒绝并非内在稳健,而是可以被提示操控。
AI 减速还是不减速:一场周末点燃的行业与政府对垒
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服
金色Web3.0日报 | 黄仁勋批驳「AI末日论」
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”
AI不会放缓
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」36氪项目新势榜:不看包装,只看项目真实进展和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿
穿透查询怎样升级为穿透管控?9月21日,深圳前海!聊聊工业AI与生态共创的下一步
分析师:四大关键因素驱动 Robinhood 链快速增长
理想落幕:加密行业为何集体走向同质化?地平线第1500万颗征程芯片搭载大众 ID. AURA T6,HSD V2.1 即将推出NVIDIA中国开发者日定档10月苏州,现场设认证考试与黑客松决赛
派早报:Steam Frame 开启预购、WPS 多端支持 Markdown 等7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开从前沿技术到产业资本,2026产业未来大会看见「深水之上」企业案例分享:伊辛智能|36氪2026产业未来大会
当AI能解千禧难题,再次证明答案不再是门槛科学家演示水下太阳能电池
香港第一、全球第八:OSL进化背后的数字资产新格局
AI风口之下,明星们又想“挤上”牌桌了
这种国民鱼一直被低估、被当廉价鱼!现在才知道钙和 DHA 这么多!快试试
GPT Image 2.5 对比实测:变化与局限
OpenAI 发布适用于编程和计算机应用的 GPT-6 Astra
黄仁勋正演讲遇特朗普突然来电:通话全程直播
Agent开始调用基础设施,Kubernetes准备好了吗?圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会58秒出杯,能拉花的咖啡机器人,在全球70国卖出600万杯