📚 Wiki 知识库

🏷️ 计算机视觉

6 篇

翻译:李飞飞关于世界模型的分类

本文基于李飞飞的观点,深入探讨了“世界模型”这一AI术语在当前语境下的定义与功能。文章通过强化学习中的POMDP框架,将世界模型系统分为三类:输出视觉观察的“渲染器”、输出物理状态的“模拟器”以及输出行动指令的“规划器”。作者指出,尽管渲染器目前商业应用最成熟,但模拟器作为连接视觉与行动的桥梁,是实现空间智能和通用机器人的关键。文章最后预测,这三类功能的边界将逐渐坍缩,最终融合为一个统一的、能够理解并交互物理世界的基础模型。

技术LLM ✍ Mr Panda🕐 2026-06-05

世界模型的功能分类法:渲染、模拟与规划

本文由李飞飞撰写,旨在厘清当下 AI 领域中“世界模型”这一概念的混淆。文章基于强化学习中的智能体循环框架,将现有的世界模型划分为三类:侧重视觉保真度的“渲染器”、侧重物理与几何结构准确的“模拟器”,以及侧重决策输出的“规划器”。作者强调,模拟器虽然公众关注度较低,但连接了视觉与行动,是实现物理世界精准交互的关键,也是空间智能的核心所在。

技术Agent ✍ Fei-Fei Li🕐 2026-06-04

DeepSeek新论文解读:用“手指着图片思考”的多模态推理框架

DeepSeek发布新论文,提出一种名为“视觉原语”的多模态推理框架。不同于业界卷分辨率的趋势,该模型通过在思维链中嵌入边界框和坐标点,模拟人类用手指着图片思考的过程,有效解决了语言在空间指代上的局限。DeepSeek-ViT配合LLM将视觉Token压缩至竞品的十分之一,但在空间推理、计数和迷宫导航等任务上性能超越GPT-5.4等顶尖模型。

技术LLM ✍ 向阳乔木🕐 2026-05-01

LeWorldModel: 利用双损失函数从像素中学习稳定的物理世界模型

文章介绍了 LeWorldModel (LeWM),一种新的世界模型架构。它解决了当前世界模型(如 DINO-WM 和 PLDM)的局限,仅通过两个损失项(Next-embedding 预测损失和 SIGReg)实现了从原始像素开始的稳定端到端训练。实验表明,LeWM 能在潜在空间中自发涌现出时间直线性和物理约束,有效避免了表示偏差和模型崩塌问题。

技术LLM ✍ Junfan Zhu 朱俊帆🕐 2026-04-23

斯坦福 AI & ML 课程清单:从入门到大模型

本文列举了斯坦福大学关于人工智能与机器学习的 10 门顶级课程,涵盖了人工智能基础、机器学习、深度学习、强化学习、自然语言处理(NLP)、计算机视觉(CV)、大语言模型(LLMs)及深度生成模型等核心领域,旨在帮助学习者掌握 AI 第一性原理。

技术LLM ✍ Andrew NG (提及)🕐 2025-12-30

骨科手术导航与规划系统技术文档

本文档详细阐述了一款骨科手术导航与规划系统的开发目的、应用场景及技术栈。该系统旨在通过三维骨骼模型重建与实时导航,提高骨科手术精准度。项目采用C++、Python、C#多语言开发,涉及OpenCV、VTK、TensorFlow等技术,源代码量约40万至60万行,涵盖影像处理、AI识别及高性能可视化等核心功能。

技术医疗 ✍ 未知🕐 2025-06-20