模型组织力:当国产Agent用多模型协作跑赢旗舰单模型
摘要
复杂任务,未必需要最强模型 一组公开基准测试结果正在引发行业重新思考AI任务的执行逻辑。在DRACO发布的100道高难度研究与分析任务评测中,一套完全基于国产模型构建的Agent系统——OpenSquilla 0.5.0,取得了60.85的...
复杂任务,未必需要最强模型
一组公开基准测试结果正在引发行业重新思考AI任务的执行逻辑。在DRACO发布的100道高难度研究与分析任务评测中,一套完全基于国产模型构建的Agent系统——OpenSquilla 0.5.0,取得了60.85的质量分,略高于最新旗舰模型Fable5的59.80。更关键的是,其单任务平均成本仅为0.39美元,不到Fable5(1.21美元)的三分之一。
在另一组横向对比中,该方案相较Claude Opus 4.8与GPT-5.5,质量分更高,成本降低幅度达86%~92%。数据背后指向一个被长期忽略的问题:面对复杂任务,是否必须默认调用单一最强模型?
Harness:决定模型如何被使用的关键层
Agent的本质,不止于基础模型。行业共识正逐渐形成:Agent = Base Models + Harness。模型提供能力,Harness决定能力如何被调度、组合与验证。
Harness涵盖上下文管理、执行控制、工具调用、输出校验与失败恢复,也包括多模型间的协同机制。它不是简单的工程封装,而是任务执行的“操作系统”。同一模型在不同Harness配置下,任务完成率差异最高可达27.4个百分点——不换模型,只改执行框架,结果就可能天差地别。
现实任务极少止步于一次问答。从理解意图、拆解步骤、检索信息、调用工具,到交叉验证与迭代修正,每个环节都存在不确定性。盲目将所有任务塞给高价旗舰模型,看似省事,实则低效:简单任务消耗昂贵算力,复杂任务仍可能因单点失误而失败。
当可用模型数量增加,选型逻辑也随之升级——不再只问“哪个最强”,而是追问“哪一步该用哪个”。Harness正是回答这个问题的基础设施。
OpenSquilla 0.5.0:让模型成为一支可协作的队伍
OpenSquilla不是新模型,而是一个开源、可本地部署的Agent运行框架。它不训练基础模型,专注在模型之上构建可编程、可验证、可调度的执行层。
其核心创新是Agentic Routing——一种步骤级动态模型路由机制。区别于传统请求入口处的一次性路由,它在Agent执行过程中持续感知当前状态,并为每一步决策匹配最适配的模型:轻量任务交由小模型快速响应;复杂推理、长文本归纳或代码生成,则触发更强模型介入;部分关键步骤甚至并行调用多个模型,各自独立提案,再由聚合模型综合判断。
在DRACO评测中,这套四模型并行提案+一模型聚合的架构展现出明显优势:
- 跨文化电商结账流程中,补全了Rakuten平台特有的30分钟取消窗口等细节;
- AI代码补全体验分析中,准确还原了调试触发与功能开发的时序关系;
- 澳洲热泵烘干机参数比较任务里,覆盖了各机型容量、能效、噪音等完整维度。
这些案例共同说明:单模型易受结构偏差与信息盲区影响;多模型异构协作,本质是用多样性对抗不确定性,再以聚合机制提升鲁棒性。
这一能力并非突然出现。OpenSquilla的演进路径清晰可见:v0.1.0实现智能降配路由;v0.3.0支持MetaSkill自组织工作流;v0.4.0引入可验证编码与签名桌面版;v0.5.0则将多模型集成正式纳入Harness层。每一次迭代,都围绕一个目标——让模型调用更可控、成本更低、交付更稳。
国产模型的价值,正在转向组合竞争力
在DRACO单模型评测中,DeepSeek V4 Pro(50.32)、Qwen 3.7(49.34)、GLM-5.2(48.28)与Fable5(59.80)仍有差距。但它们的角色已悄然转变:不再是“低价替代品”,而是在不同任务类型中形成能力互补的组件。
与此同时,模型组织方法也在成熟。Agentic Routing已从“按问题选模型”,进化为“按执行状态调度模型”。OpenSquilla的路由设计包含四层判断:复杂度过滤、任务类型分类、上下文状态识别、最终模型排序。关键突破在于——系统开始理解“任务走到哪一步”,而非仅理解“用户问了什么”。
前期拆解可用低成本模型快速推进;证据链断裂时自动切换至强模型重建;验证失败后触发修正路径……每一次路由决策还沉淀执行数据,反哺后续优化。路由越精准,单位预算所能支撑的任务量就越大,系统自我进化能力就越强。
Agent的终点,是稳定交付
AI落地的终极标尺,从来不是榜单排名,而是能否在真实场景中稳定交付:任务能不能完成、结果能不能验证、成本能不能覆盖。
OpenSquilla代表的思路,是把降本逻辑从“简单降配”升级为“能力匹配”——不是一味用便宜模型替换贵模型,而是精确识别:哪些步骤必须强模型兜底,哪些环节小模型足以胜任,哪些场景需要多模型交叉验证。它追求的,是在质量与成本之间找到可持续的平衡点。
当模型使用成本可通过系统工程显著压缩,那些曾因ROI不足被搁置的项目,便有了重启评估的可能。用户真正关心的,不是背后调用了几个模型,也不是某个模型在某榜单排第几,而是:同样预算下,系统能稳定完成多少任务?出错后能否自动恢复?结果是否可验证、可交付?
效率红利的重心,正从基础模型研发,向模型组织与执行框架迁移。DRACO的100道题只是切片,但它释放了一个明确信号:通往复杂任务高质量交付的路径,不止一条。把现有模型组织得更细、更稳、更经济,本身就是一条值得深耕的技术主线。
评论 (5)
AI落地得看实际效果,OpenSquilla在成本和质量间找平衡,能让更多项目重启,这才是关键。
这文章说明选模型不用只盯着最强的,让不同模型配合着干,既完成任务又省成本,很实用。
国产模型单拎出来比不过旗舰,但组合起来有竞争力,这思路不错,以后估计会发展得更好。
OpenSquilla这框架厉害啊,能根据任务状态选模型,让模型像团队一样协作,解决问题更稳。
模型组织方法和执行框架越来越重要,以后不能只关注模型研发,还得重视怎么组织模型干活。