谁是Deepseek最佳的马具?
谁是Deepseek最佳的马具?
——对比五种不同的智能体框架
日期:2026.8.9
前言
众所周知,在人工智能领域,智能体(Agent)是实现自主决策和任务执行的核心组件。随着技术的发展,越来越多的智能体框架被提出,每种框架都有其独特的优势和适用场景。公司如 Anthropic、OpenAI 都有开发针对其基模 Claude、GPT 优化的智能体框架(更多是代码智能体)如 Claude code、Codex。而与之不同的是,Deepseek 背后的研发团队——杭州深度求索——并没有开发针对其模型的智能体框架,因此本文将聚焦于 Deepseek 基模,对比五种不同的智能体框架,以帮助开发者选择最适合其需求的工具。
需要承认的是,本文的实验来源于 b 站 up 主 @科技迷航 发布于2026年8月6号的视频 《谁才是DeepSeek的最佳坐骑?》。
实验设计
实验选择了以下五种智能体框架进行对比:

ZCode 是由智普开发的,针对其产品——GLM系列大模型的代码智能体框架。
Codex 是由 OpenAI 开发的,针对其 GPT 系列大模型的代码智能体框架。
Reasonix 是由社区开发的,针对 Deepseek 优化的开源智能体框架。
OpenCode 是由社区开发的通用型开源智能体框架。
Claude Code 是由 Anthropic 开发的,针对其 Claude 系列大模型的代码智能体框架。
随后,实验根据真实项目,设计了五种不同的任务场景(共 7 题)来测试这些智能体框架的性能,并按照任务完成的效率、准确性和资源消耗等指标进行评估。每个任务场景都模拟了实际应用中的典型问题,以确保实验结果具有参考价值。
五种任务场景分别为:
- 代码排障(debug)任务(共 3 题):
- 字符串校验引擎排障
- 日期时间引擎排障
- 渲染引擎排障
- 代码开发任务(共 1 题):请求库自动重试开发。
- 信息推理任务(共 1 题):港火事故资料核验。
- 信息核查任务(共 1 题):文献真伪核查。
- 数据分析任务(共 1 题):电商订单真相还原。
对于每一个任务(题目),智能体将能够接受总计两轮的反馈来修改输出(即总共三轮输出),实验按照不同维度的指标给出分数(对于每一指标,一轮通过拿满分,每过一轮分数减半),同时记录token消耗与完成用时。
评分指标示例: \

实验结果
题目一:字符串校验引擎排障

速度最快的是 ZCode,完成时间为 8 分钟,用时最长的是 Claude Code,完成时间为 29 分钟。准确性方面,Codex 得分最高,为95.50分。
题目二:日期时间引擎排障

与题目一相比,题目二的难度大大增加,完成时间普遍延长。Codex 在这一题表现反而最差,完成时间为 85 分钟,且仅得到61.70分。 Claude Code在这一题表现最好,用时最短为 53 分钟,且得分最高为72.50分。值得注意的是,ZCode在这一题的表现也不俗,完成时间为 89 分钟,得分为72.10分。
题目三:渲染引擎排障

在题目三中,Codex的表现依然不佳,完成时间为 85 分钟,得分为69.70分。ZCode 以38分钟完成,77.50分的成绩位居第一。Reasonix 则以80分钟完成,77.50的得分位居第二。Claude Code在这一题的表现也不俗,完成时间为 25 分钟,得分为72.50分。
值得注意的是,Codex在第三题遇到了与第二题一样的问题,在反馈轮(二、三轮)容易将对的答案改错,导致得分下降。相比之下,其余智能体均在反馈轮中表现稳定,能够有效利用反馈信息进行优化。
题目四:请求库自动重试开发

在题目四中,Codex的表现依然不佳,完成时间为 34 分钟,得分为80.00分位列倒数第二。Reasonix 以 22 分钟完成,得分为 95.00分位列第一。 在这一题中,ZCode犯了与Codex在前两题中类似的错误,在反馈轮中将正确答案改错,导致得分下降,尽管这是一个相对简单的开发任务,所有智能体在第一轮输出中都能给出较高质量的答案。
题目五:港火事故资料核验

题目五是一个更加考察基模能力的题目,要求智能体基于一大堆资料推导出正确的事实结论。Codex在这一题中表现最差,完成时间为 7 分钟最长,得分为98.80分。而其余选手只需在5分钟内就能得到满分。
题目六:文献真伪核查

题目六一共准备了20篇文献,其中10篇为真,10篇为伪。智能体需要在20篇论文中找出伪文献,并给出理由。虚假文献中,3篇为凭空捏造,7篇为真实文献的伪造(修改)版本。5种智能体在这一题中表现都非常出色,除 Reasonix 与 Claude Code 之外,其他智能体均在10分钟内完成任务。所有智能体都只判断错了一篇文献。以下是具体细节: \

除 Claude Code 将一篇虚假文献误判为真文献外,其他智能体均将真实文献为虚假文献。因此笔者认为,Claude Code在这一题表现较其他智能体稍逊一筹。
题目七:电商订单真相还原

题目七是一个数据分析任务,要求智能体基于电商订单数据,分析出订单是否存在异常,并给出解决方案。该题偏简单,所以智能体均得到了99.50分且耗时在5分钟以内。
总结
以下为五种智能体在七个任务中的综合表现:
分数

智能体按得分排序为:Claude Code > ZCode > Reasonix > OpenCode > Codex。
效率

智能体按效率排序为:Claude Code > ZCode > OpenCode > Codex > Reasonix。
价格

智能体按价格排序为:ZCode < OpenCode < Claude Code < Codex < Reasonix。 这一点让人有些意外:号称针对 Deepseek 缓存命中优化的 Reasonix,价格却是五种智能体中最高的。 笔者认为,在多轮对话的时候,85-95%缓存命中的时候,模型比较“聪明”。再高的缓存命中可能导致模型沿用曾经的错误推理,反而增加了工作时间与API调用次数,导致虽然单次调用价格便宜,但更多的调用抹杀了这一优势。
结论
综合得分、效率和价格三个维度来看,Claude Code 在本次实验中表现最为出色,尤其在任务完成的准确性和效率上均有优势。
ZCode 作为一个针对 GLM 系列大模型优化的智能体框架,在本次实验中也表现不俗,尤其在代码排障任务中展现了较强的能力,@科技迷航认为这可能是因为GLM与Deepseek都没有视觉模态导致的。
Reasonix 虽然在某些任务中表现良好,但其高昂的价格和在多轮反馈中的不稳定表现,使其在综合评价中略显逊色。
OpenCode 作为一个通用型开源智能体框架,虽然在某些任务中表现中规中矩,但在效率和价格上具有一定优势。
Codex 在本次实验中表现最为不理想,尤其在多轮反馈中容易将正确答案改错,导致得分下降,这也反映了其在处理复杂任务时的局限性。
虽然视频作者认为 ZCode 是 Deepseek 的最佳坐骑。但笔者从统计的角度出发,认为本次实验中五种智能体的差异在统计学上并不显著,尤其是对于任务完成的准确性和效率指标。 因此,选择哪种智能体框架应根据具体的应用场景和需求来决定,而不仅仅依赖于实验结果。换句话说,本次实验恰恰说明了在选择 Deepseek 作为智能体基模的条件下,不同智能体框架的表现没有明显的优劣之分,开发者应根据自身需求和预算进行选择,自己用的顺手的才是最好的。
附录— 题目一览
题目一:字符串校验引擎排障

题目二:日期时间引擎排障

题目三:渲染引擎排障
缺失。
题目四:请求库自动重试开发

题目五:港火事故资料核验

题目六:文献真伪核查

题目七:电商订单真相还原
