📚 Wiki 知识库

🏷️ 算法

7 篇

如何制造病毒式传播内容:180亿次浏览背后的方法论

作者分享了通过180亿次浏览量总结的病毒式传播秘诀。文章指出流量并非随机,而是基于算法机制的工程化结果。核心包括:制造能力差距的钩子、高信息密度的视觉节奏以及完美的循环结构。此外,还介绍了四种内容框架和大规模的分发策略,强调一切皆在数据之中。

技术工具与效率 ✍ Reece | Clipping Agency🕐 2026-07-24

突破OPD天花板:MAD-OPD让小模型通过多教师辩论反超大模型

文章介绍了一种名为 MAD-OPD 的新算法,旨在解决 OPD(On-Policy Distillation)中单教师模型存在盲点导致学生模型学习受限的问题。通过引入多智能体辩论机制,让多个教师围绕学生状态互相纠错并达成共识,再进行蒸馏。实验表明,该方法在 14B+8B 到 4B 的蒸馏任务中,不仅提升了代码生成能力,还在 Agentic 任务中实现了小模型反超大教师的突破。

技术LLM ✍ 青稞社区🕐 2026-07-13

2026年强化学习面试题库:算法与基础设施

本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。

技术LLM ✍ Xiuyu Li🕐 2026-06-08

我把小红书限流当线上 bug 排查了 14 天:首页推荐从 1% 救到 56.5%(附 5 条反共识 SOP)

本文作者分享了其小红书账号遭遇限流后,通过逆向工程思维进行排查与修复的经历。作者将限流视为系统故障,经过14天的调整,成功将首页推荐占比恢复至56.5%。文章提出了5条反共识观点:精准诊断降权类型、停发优于改内容、隐藏优于删除、重视CES互动权重以及将账号视为可维护系统,并附带了详细的14天恢复SOP清单。

职场方法论 ✍ MapleShaw🕐 2026-05-19

SFT、RL 与 On-Policy 蒸馏:原理与差异

本文深入探讨了模型后训练中的 SFT 与 RL 流程,重点分析了基于同族模型(Same-family)的 On-Policy 蒸馏(OPD)技术。文章解释了 SFT 存在性能天花板的原因,以及 RL 如何通过复利效应突破这一限制。作者指出 OPD 结合了 SFT 的低成本和 RL 的复合优势,能高效利用教师模型的反向 KL 散度信号,是实现高性能模型微调的关键手段。

技术LLM ✍ will brown🕐 2026-05-01

后端工程师必知的20个并发编程核心概念

Atlassian 首席工程师总结的后端面试与系统设计中的 20 个并发编程核心概念。文章涵盖了从基础的并发与并行、进程线程区别,到互斥锁、信号量、死锁、CAS、线程池及生产者-消费者模式等进阶主题。旨在帮助工程师掌握并发原语,理解性能权衡,从而构建可靠的生产级系统。

技术后端 ✍ Puneet Patwari🕐 2026-04-22