📚 Wiki 知识库

🏷️ 数据工程

5 篇

How we built our knowledge base

Cerebras 分享了构建其内部知识库的经验。该知识库每天处理超过 15,000 个问题,集成了 Slack、GitHub 等多种数据源。文章详细介绍了如何通过 Postgres 存储 embeddings,并采用混合搜索策略(全文搜索、向量搜索、IDF 加权、时间衰减)来高效检索非结构化对话数据,解决了信息分散和匹配精度的问题。

技术DevOps ✍ Cerebras🕐 2026-07-18

Adam's Law:为何高频表达能解锁 LLM 的最强性能

文章介绍了 FaceMind 团队提出的 Adam's Law(文本频率定律),即在语义不变前提下,使用预训练语料中频率更高的表达方式能显著提升 LLM 表现。该发现通过 100 种语言和四大核心任务得到验证,并指出当前数据工程忽视了“频率”这一关键维度。Anthropic 的 Claude Opus 4.7 更新间接验证了这一理论。

技术LLM ✍ Berryxia.AI🕐 2026-05-30

π0.7 与机器人数据公司的误区

文章批评了仅靠堆砌人类数据解决机器人问题的观点,深度解析了 Physical Intelligence 的 π0.7 论文。π0.7 通过拒绝仿真数据、利用子目标图像作为引导(Affordances)、以及增加详细的任务元数据(如子目标、子任务指令)来解决数据冲突,实现了跨具身迁移和更好的指令遵循。作者指出,机器人数据公司应通过自建机器人并提供高质量注释来创造价值,而非单纯销售原始数据。

技术Agent ✍ Shreyas Gite🕐 2026-04-22

系统工程:构建有效的智能体软件

文章提出构建智能体软件应采用系统工程思维,而非仅优化局部组件。作者提出了软件工程的五个关键层面:代理工程、数据工程、安全工程、接口工程和基础设施工程。文章通过开源项目 Dash 演示了如何将 RBAC、数据隔离和多接口集成等原则应用于实际开发中,强调智能体本质仍是软件,需遵循经典的系统设计原则。

技术Agent ✍ Ashpreet Bedi🕐 2026-04-08

你不知道的大模型训练:原理、路径与新实践

本文深入探讨了大模型训练的全链路流程,指出2026年模型效果的差距主要源于后训练阶段。文章从预训练底座、数据配方、系统架构约束、后训练(SFT/RLHF/DPO)以及 Eval/Reward 机制五个维度,解析了如何通过工程化手段提升模型实际落地效果,并引用了 DeepSeek、Llama 等实例。

技术LLM ✍ Tw93🕐 2026-04-03