How we built our knowledge base
Cerebras 分享了构建其内部知识库的经验。该知识库每天处理超过 15,000 个问题,集成了 Slack、GitHub 等多种数据源。文章详细介绍了如何通过 Postgres 存储 embeddings,并采用混合搜索策略(全文搜索、向量搜索、IDF 加权、时间衰减)来高效检索非结构化对话数据,解决了信息分散和匹配精度的问题。
Cerebras 分享了构建其内部知识库的经验。该知识库每天处理超过 15,000 个问题,集成了 Slack、GitHub 等多种数据源。文章详细介绍了如何通过 Postgres 存储 embeddings,并采用混合搜索策略(全文搜索、向量搜索、IDF 加权、时间衰减)来高效检索非结构化对话数据,解决了信息分散和匹配精度的问题。
文章介绍了 FaceMind 团队提出的 Adam's Law(文本频率定律),即在语义不变前提下,使用预训练语料中频率更高的表达方式能显著提升 LLM 表现。该发现通过 100 种语言和四大核心任务得到验证,并指出当前数据工程忽视了“频率”这一关键维度。Anthropic 的 Claude Opus 4.7 更新间接验证了这一理论。
文章批评了仅靠堆砌人类数据解决机器人问题的观点,深度解析了 Physical Intelligence 的 π0.7 论文。π0.7 通过拒绝仿真数据、利用子目标图像作为引导(Affordances)、以及增加详细的任务元数据(如子目标、子任务指令)来解决数据冲突,实现了跨具身迁移和更好的指令遵循。作者指出,机器人数据公司应通过自建机器人并提供高质量注释来创造价值,而非单纯销售原始数据。
文章提出构建智能体软件应采用系统工程思维,而非仅优化局部组件。作者提出了软件工程的五个关键层面:代理工程、数据工程、安全工程、接口工程和基础设施工程。文章通过开源项目 Dash 演示了如何将 RBAC、数据隔离和多接口集成等原则应用于实际开发中,强调智能体本质仍是软件,需遵循经典的系统设计原则。
本文深入探讨了大模型训练的全链路流程,指出2026年模型效果的差距主要源于后训练阶段。文章从预训练底座、数据配方、系统架构约束、后训练(SFT/RLHF/DPO)以及 Eval/Reward 机制五个维度,解析了如何通过工程化手段提升模型实际落地效果,并引用了 DeepSeek、Llama 等实例。