📚 Wiki 知识库

🏷️ 视觉推理

2 篇

DeepSeek新论文解读:用“手指着图片思考”的多模态推理框架

DeepSeek发布新论文,提出一种名为“视觉原语”的多模态推理框架。不同于业界卷分辨率的趋势,该模型通过在思维链中嵌入边界框和坐标点,模拟人类用手指着图片思考的过程,有效解决了语言在空间指代上的局限。DeepSeek-ViT配合LLM将视觉Token压缩至竞品的十分之一,但在空间推理、计数和迷宫导航等任务上性能超越GPT-5.4等顶尖模型。

技术LLM ✍ 向阳乔木🕐 2026-05-01

DeepSeek新论文解读:让AI像人一样“用手指着图片思考”

文章详细解读了 DeepSeek 关于多模态推理的新论文。该研究提出一种“视觉原语”框架,让模型在推理过程中直接输出坐标和框,像人类用手指指物一样进行空间思考。这种方法仅用传统模型十分之一的视觉 Token,就在计数、拓扑推理等任务上达到了超越 GPT-5.4 和 Claude-Sonnet-4.6 的效果。文章还深入分析了模型在迷宫导航和路径追踪等任务上的数据合成与训练策略。

技术LLM ✍ 向阳乔木🕐 2026-05-01