该微调方法主要提升模型的什么能力?
主要提升模型对结构化输出的格式与模式符合能力,使LFM2.5-350M在IFStruct基准上的通过率从22.6%提高到29.7%。
(翻译)用100步GRPO微调350M模型以获得更好的结构化输出
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
本文介绍使用TRL库对LFM2.5-350M模型进行GRPO微调,结合约500条样本和100个训练步骤来提升结构化输出能力,在IFStruct基准上从22.6%提升至29.7%。内容涵盖LoRA配置、三项奖励函数的设计、训练参数、模型合并及GGUF转换评估流程。
主要提升模型对结构化输出的格式与模式符合能力,使LFM2.5-350M在IFStruct基准上的通过率从22.6%提高到29.7%。
使用了三个奖励函数:json_format_reward、field_count_reward和schema_validation_reward,权重分别为1.0、0.5和2.0。
大约使用500条训练样本和100个训练步骤,模型规模适合在免费版Colab或Kaggle GPU上运行。
Agent开始调用基础设施,Kubernetes准备好了吗?
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成Rust
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code
超越代币化:让RWA在链上发挥实用价值
2人团队0融资,用AI搓的复古相机APP霸榜韩国总榜第4,还做到了3个月10亿销售额?从前沿技术到产业资本,2026产业未来大会看见「深水之上」
二次元“赛博分身”撬动日本市场:玩家“沉默”的AI陪伴产品,凭什么次留60%?科学家演示水下太阳能电池英伟达带动AI数据中心大变革,中国厂商不想当边缘人
AI没有泡沫 只有割裂和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿36氪研究院 | 2026年北京市OPC创业者研究报告
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each
AI风口之下,明星们又想“挤上”牌桌了
推特创始人谈“AI减速”论:前沿不属于任何一家公司
关于项目交付的思考:部署是最后两公里,验收才是最后一公里基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
iPhone 18 Pro & Duo 首发评测,提升最大的是「充电」和这个…
王强宇履新百望:从发票SaaS工具,到财税垂直大模型,再到企业的Palantir
从接住告警到自我进化:快手智能运维助手实践|QCon上海
“裁判”不想给阿莫迪吹暂停XCancel 服务再次下线
YC 最值钱的这 20家公司,没有一家来自最近5年
川普让步了 为何Clarity法案还遭到全体民主党人反对
我和我的 AI 手机吃了 3 顿饭
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招Windows 11 的 9 月例行安全更新再次引发了大量故障
AMC 炮轰 Robinhood:股票归谁做主?
特朗普“一再让步”:美国加密法案仍未过关