📚 Wiki 知识库

🏷️ 性能测试

2 篇

全自动 Coding Agent 实战:大模型规划,小模型干活

文章验证了一个关于多 Agent 编排的猜想,通过搭建 hero-coding MVP,对比了 ChatGPT 5.4、Ling-2.6-flash 和 Ling-2.5-1T 在编码任务中的表现。结果显示,非思考小模型(Flash)在明确 Bug 修复上比思考模型快 31%,而 Ling-1T 在加功能任务上仅需 11% 的 Token 和 63% 的时间。作者总结出“大模型规划,小模型干活”的最佳实践,并强调了非思考模型必须配合 Harness 工程兜底的重要性。

技术Agent ✍ 劳伦斯🕐 2026-04-29

火山方舟 vs 阿里百炼|Coding Plan 实测对比报告

本文对比了字节火山方舟与阿里百炼两大平台的 Coding Plan API 服务性能。通过 270 次请求测试,从响应速度、吞吐量(TTS)和稳定性三个维度,对包括 GLM、Kimi、DeepSeek 等主力模型进行了评估。结果显示,对于相同的旧版本模型,阿里百炼在速度上完胜;而字节方舟在模型更新速度(如 k2.6)和覆盖广度上更具优势。

技术LLM ✍ luolei🕐 2026-04-22