📚 Wiki 知识库

🏷️ 模型测评

4 篇

Claude Fable 5 正式发布:神话级能力的全面解析与思考

Anthropic 正式发布了 Claude Fable 5 模型,该模型是此前仅限合作伙伴使用的“神话级”网络安全模型 Mythos 的公开版本,新增了安全分类器。文章详细介绍了 Fable 5 的技术定位、昂贵的 API 定价(显著高于 DeepSeek V4 和 GPT 5.5)、以及在代码生成、视觉游戏通关(如宝可梦、异星工厂)、生命科学(蛋白质设计)等方面展现出的惊人能力。作者在亲测后,对其“究极水桶”般的智能水平表示震撼,同时也因昂贵的费用和 AI 进步速度超越人类认知而产生的虚无感进行了深度思考。

技术Claude ✍ 数字生命卡兹克🕐 2026-06-10

国产模型 API 接入 Codex 实测:Agent 工作流可行性与玩法指南

文章详细记录了将阶跃星辰(Step)等国产大模型 API 接入 Codex App 的全过程与测试结果。作者验证了在 API 模式下,Codex 的手机调用、锁屏截图、浏览器自动化及电脑控制等核心功能依然可用。同时,文章对比了不同模型的性价比,探讨了 API 模式在记忆管理和多设备联动上的局限性,并分享了 Codex 在自动化、长期目标设定及与其他 Agent 工具协作中的最佳实践。

技术Agent ✍ 卡尔的AI沃茨🕐 2026-05-26

被低估的 Kimi K2.6:300 个子代理并行与免费部署指南

本文深入探讨了 Moonshot AI 的开源模型 Kimi K2.6,强调其独特的“群体智能”架构,能协调 300 个子代理并行处理复杂任务。文章对比了 Kimi 与 Claude 的优劣,展示了 Kimi 在数据抓取、代码优化和网页生成方面的实战能力,并详细介绍了如何利用 Cloudflare Workers AI 和 Open Code 免费部署该模型。

技术Agent ✍ Defileo🕐 2026-05-03

千元横测 GPT、DeepSeek、Xiaomi、MiniMax:最强模型与 Agent 的绝配组合

本文详细横评了 GPT 5.5、MiniMax M2.7、DeepSeek V4 Pro 和小米 Mimo-V2.5-Pro 四款大模型在 Hermes Agent 场景下的表现。通过 Skill 打包、网页开发、PPT 制作、知识库整理及浏览器自动化五项任务,测试了各模型的逻辑推理、审美迁移、长文本处理及 API 消耗能力。最终结果显示,不同模型在 Agent 任务中各具特色,需根据具体场景选择最优解。

技术Agent ✍ 卡尔的AI沃茨🕐 2026-05-01