GMA基准是什么?
GMA是一个用于在挑战性真实场景中评测通用移动助手的基准,包含七个基于开源项目的应用和300个任务。
(翻译)挑战性真实场景下通用移动助手的基准评测
Abstract page for arXiv paper 2608.27477: Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
arXiv论文提出GMA基准,用于在挑战性真实场景中评测通用移动助手。该基准基于开源项目引入七个应用、300个任务,分四个难度层级。研究评测了八个前沿模型,发现任务复杂度增加时性能显著下降,同时测试了代理框架设计(如上下文保留、显式状态跟踪)的影响,表明合理框架设计可提升表现。
GMA是一个用于在挑战性真实场景中评测通用移动助手的基准,包含七个基于开源项目的应用和300个任务。
GMA扩展了应用覆盖范围和任务复杂度,涵盖生活方式分享、旅行规划等场景,任务分四个难度层级,并支持对代理框架设计的受控消融研究。
HIP-3:昂贵的入场券 买不来的护城河
一边喊停一边敲钟:硅谷AI巨头到底在怕什么
当罗永浩站在群众的对立面Optimizing cost and latency with Amazon Bedrock prompt caching清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
百度做了一堆AI产品,却没有一个能代表百度?
CLARITY的失败 跟加密行业好坏没啥关系
New insights from Google’s AI & Economy ATLAS圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
OpenAI 发布适用于编程和计算机应用的 GPT-6 Astra
AMC 炮轰 Robinhood:股票归谁做主?
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
BTC电力消耗可能已经见顶 2025年12月或为历史峰值
云连锁到轻连锁,品牌业务逻辑的改变
缓存不该困在一台服务器里XCancel 服务再次下线从前沿技术到产业资本,2026产业未来大会看见「深水之上」
企业该买模型还是养上下文?一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影
GPT-6 Astra实现具身智能突破 中国如何打具身防卫战
长期利率为何不愿下跌?豆包手机明日开卖,AI能帮你操作App了吗?
510万一张!携程上架太空旅行船票:已有681人购买,还得自己买保险;娃哈哈因拖欠员工公积金被查封办公楼;华为放权!问界将由赛力斯主导FAST 发现极短周期、最轻双中子星系统
从”边卖边补”到”准备好再卖”:产品商品化的四步闭环
CLARITY法案投票失败 加密监管立法再度搁浅
从 270 分钟到 18 分钟:B 端产品经理如何主导一个 AI 达人撮合系统36氪项目新势榜:不看包装,只看项目真实进展
分析师:四大关键因素驱动 Robinhood 链快速增长
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each