📚 Wiki 知识库

🏷️ 视觉Token

1 篇

DeepSeek新论文解读:让AI像人一样“用手指着图片思考”

文章详细解读了 DeepSeek 关于多模态推理的新论文。该研究提出一种“视觉原语”框架,让模型在推理过程中直接输出坐标和框,像人类用手指指物一样进行空间思考。这种方法仅用传统模型十分之一的视觉 Token,就在计数、拓扑推理等任务上达到了超越 GPT-5.4 和 Claude-Sonnet-4.6 的效果。文章还深入分析了模型在迷宫导航和路径追踪等任务上的数据合成与训练策略。

技术LLM ✍ 向阳乔木🕐 2026-05-01