📚 Wiki 知识库

DeepSeek新论文解读:用“手指着图片思考”的多模态推理框架

向阳乔木🕐 2026-05-01📦 35.7 KB 🟢 已读 𝕏 文章列表

DeepSeek发布新论文,提出一种名为“视觉原语”的多模态推理框架。不同于业界卷分辨率的趋势,该模型通过在思维链中嵌入边界框和坐标点,模拟人类用手指着图片思考的过程,有效解决了语言在空间指代上的局限。DeepSeek-ViT配合LLM将视觉Token压缩至竞品的十分之一,但在空间推理、计数和迷宫导航等任务上性能超越GPT-5.4等顶尖模型。