端侧模型崭露头角!面壁智能推出新一代通用Agent
近年来,端侧大模型取得了显著进展,不断挑战和扩展其能力的极限。最早,人们关注的是移动设备能否支持基本的语言模型,随后,长文本理解、数学推理、代码生成和多语言处理等功能逐渐被整合到更小的模型中。如今,随着这些模型能力的进一步增强,出现了一个新问题:Agent能力是否能从云端迁移到设备端?这并非仅仅是将一个聊天模型嵌入设备,真正的Agent需要理解任务目标、分解任务、调用各种工具,根据反馈实时调整策略,并在多轮互动中持续推进任务的完成。
面壁智能正是致力于推动这一进程的先锋之一。其最新发布的MiniCPM5-2B端侧语言模型于9月8日开源,为实现端侧通用Agent能力奠定了基础。该模型引入了工具调用、深度搜索和代码生成等智能体的核心能力,使复杂任务在设备本身上运行成为可能。此外,团队不仅开源了模型权重和算法,还包含了一部分训练配方(如强化学习配方)、自研的强化学习框架Meshy、基于奖励的强化学习策略JustRL II,以及一系列SFT数据,这在目前的大模型开源生态中是非常少见的。
尽管MiniCPM5-2B轻巧,但其能力并不弱。根据Artificial Analysis Intelligence Index的排行榜,它在开源模型类别中排名第一,综合评测包括知识推理、代码能力及Agent任务执行等多个方面,MiniCPM5-2B以23分领先于参数规模更大的Gemma 4 12B和Qwen3.5 9B等模型。在关于Agent工作流的评比中,它也以20分名列前茅,超越了Granite 4.2 8B(9分)和Qwen3.5 9B(7分)等更大模型。MiniCPM5-2B在推理效率方面同样表现优异,处理单一任务平均只需约21K的输出标记,相对同规模模型来说效率较高。
值得注意的是,MiniCPM5-2B在真实工作任务评测中取得了接近于人类的优秀表现,显示了端侧模型能力已从简单的问答转向更复杂的任务处理。其智能密度也出色,进入了同级开源模型的前列。在综合能力评测中,它的平均分达到53.9分,超越了Qwen3.5-2B等其他模型,评测覆盖了多个维度,如代码推理、数学推理、工具调用和搜索智能体等,证明其能力提升并非来源于单一方面,而是整体能力的增强。
MiniCPM5-2B的发布标志着端侧通用Agent能力的初步成形。传统上,提到Agent,人们往往认为只有云端大模型才能够胜任。MiniCPM5-2B的价值在于,它将端侧和通用Agent两者有效结合:模型原生支持工具调用、深度搜索和代码生成等核心智能体能力,并且在预训练阶段就已经为Agent能力的实现铺平了道路,贯穿至强化学习阶段,确保这些功能在实际应用中的稳定性和可靠性,而非仅仅是能够运行但效果不佳的产物。
在强化学习阶段,MiniCPM5-2B还采用了面壁智能自研的框架Meshy和奖励驱动的学习策略JustRL II,在训练框架方面,Meshy摒弃了传统的中央控制器和Ray依赖,将训练、推理和奖励计算等环节建模为对等服务,并通过TransferQueue的数据状态驱动实际控制流,支持在三种训练模式中灵活切换。
在算法层面,针对端侧模型进行长链思维的强化学习时,常常在训练中出现得分不升反降的情况,主要因为训练数据噪声多且难度不匹配,容易导致奖励信号偏离目标。为此,MiniCPM团队提出了JustRL II:在数据上,使用三阶段流水线进行训练数据的筛选与校准;在算法上,增强了GRPO的信用分配,使其在面对复杂的推理链时能够实现更加精细的评分。得益于JustRL II,MiniCPM5-2B在强化学习后的训练中取得了明显的性能提升。
真实效果如何?我们进行了一些测试。用户可以访问开源地址获取该模型并部署体验。首先,我们将MiniCPM5-2B用于处理一份AI生成的长篇会议纪要。测试过程中,我们连续提出多个问题,如会议缺席人员是谁、Atlas V2.0的正式上线日期等。测试结果显示,MiniCPM5-2B能够从长文本中提取关键信息,并清楚地区分讨论内容与最终结论,回答准确,满足了实际应用需求。接下来我们让
南京同曦篮球俱乐部签下美籍前锋罗伯特-弗兰克斯
组织足球相关的团建活动和友谊赛,增强团队合作和沟通能力。...
AI评析曼联与沙巴巴库之战:主胜明显,平局也有可能
组织足球相关的团建活动和友谊赛,增强团队合作和沟通能力。...