📚 Wiki 知识库

🏷️ 模型对比

4 篇

全自动 Coding Agent 实战:大模型规划,小模型干活

文章验证了一个关于多 Agent 编排的猜想,通过搭建 hero-coding MVP,对比了 ChatGPT 5.4、Ling-2.6-flash 和 Ling-2.5-1T 在编码任务中的表现。结果显示,非思考小模型(Flash)在明确 Bug 修复上比思考模型快 31%,而 Ling-1T 在加功能任务上仅需 11% 的 Token 和 63% 的时间。作者总结出“大模型规划,小模型干活”的最佳实践,并强调了非思考模型必须配合 Harness 工程兜底的重要性。

技术Agent ✍ 劳伦斯🕐 2026-04-29

火山方舟 vs 阿里百炼|Coding Plan 实测对比报告

本文对比了字节火山方舟与阿里百炼两大平台的 Coding Plan API 服务性能。通过 270 次请求测试,从响应速度、吞吐量(TTS)和稳定性三个维度,对包括 GLM、Kimi、DeepSeek 等主力模型进行了评估。结果显示,对于相同的旧版本模型,阿里百炼在速度上完胜;而字节方舟在模型更新速度(如 k2.6)和覆盖广度上更具优势。

技术LLM ✍ luolei🕐 2026-04-22

OpenAI的GPT-image2能带来一波起号潮吗?

文章深入评测了 OpenAI 的新生图模型 GPT-image2,认为其虽然进步巨大,具备母语级中文理解能力和卓越的细节可控性,但推出时机过晚,提示词变现红利期已被 Gemini 的 Nano Banana Pro 吃尽。作者指出,未来 AIGC 将不再依赖复杂的“神仙提示词”,而是比拼创作者的构图与审美内卷。

技术OpenAI ✍ 𝟡𝟜 𝚅̷𝙰̷𝙽̷ ᴾᴸᴬʸᶠᴼᴿᴳᴱ🕐 2026-04-17

提示词救不了平庸的 AI 写作

文章指出 AI 写作的质量关键不在于提示词,而在于素材质量、模型能力和审稿能力。作者将 AI 写作比作做菜,认为只有提供高质量的素材(食材),选择顶级的模型(厨艺),并具备优秀的审稿能力(试菜),才能产出优质内容。提示词仅相当于调料,只能起到锦上添花的作用。

技术LLM ✍ 宝玉🕐 2026-02-20