上海交大团队出品的大模型实战开源课程
上海交大团队推出的大模型实战开源课程,在GitHub获4.6w+ star。课程从零开始设计,包含API调用、模型微调、多模态开发等模块,配套在线实验环境,适合系统学习大模型知识。
上海交大团队推出的大模型实战开源课程,在GitHub获4.6w+ star。课程从零开始设计,包含API调用、模型微调、多模态开发等模块,配套在线实验环境,适合系统学习大模型知识。
文章探讨了超越传统提示词的多模态交互技术,提出“任务”概念,通过结合语音、屏幕、文本等多种信息源,让代理更高效地完成复杂工作。该方法减少交互循环,提升并行工作能力,并通过存储执行痕迹逐步转化为可重用的技能,为未来全模型交互奠定基础。
腾讯正式推出设计Agent平台Miora,由WorkBuddy团队打造。该平台支持品牌设计、UI设计等五大场景,具备模型切换、技能市场和项目记忆功能。作者实测了品牌VI全案生成,展示了其在设计工作流中的潜力,标志着设计Agent进入白热化竞争阶段。
本文从深度流形视角分析 Thinking Machines 的多模态模型 Inkling。探讨了模态早期耦合、放弃 RoPE 的几何意义、Muon 的归一化作用以及大规模强化学习对流形同调的影响,提出了关于数据耦合和训练稳定性的开放问题。
作者分享了使用 Kimi K3 模型的实际体验,通过 3D 坦克大战游戏、权力游戏地图动画和教学视频制作三个案例,展示了其在多模态和复杂任务处理上的强大能力。文章指出 K3 提供了 Claude 和 Codex 之外的优质选择,且具备合规性优势,但同时也面临算力短缺的局限。
PixelRAG 是一种开源的视觉化网页检索技术,通过直接截图并使用视觉模型分析像素,而非依赖 HTML 解析,从而避免信息丢失。它构建了 3000 万维基百科截图的视觉索引,在问答任务上超越传统文本 RAG 基准 18.1%,并支持 Claude 代码插件。
本文是一份针对小白的 Codex 终极使用教程。文章首先指出了 Codex 在多模态和办公场景(如生成 PPT)相较于 DeepSeek V4 的优势,详细介绍了如何通过 CC Switch 工具将性价比高且原生支持多模态的 Kimi 模型接入 Codex。此外,作者还分享了通过 Skill 功能将工作流程固化并设置定时任务的实战案例,旨在帮助用户将重复性工作自动化,极大提升职场效率。
文章介绍了如何利用阿里云魔搭 ModelScope 每日 2000 次的免费 API 额度,将其接入 Agent 工作流以降低 AI 创作成本。作者详细讲解了账号注册、API Key 获取、模型筛选与调用的全过程,并开源了一个名为 `tiezhu-modelscope-api-inference` 的 Skill,实现了自动额度管理和多模态任务处理。
文章指出提示词时代正在退场,掌握“喂料能力”才是 AI 视频创作的关键。作者以 Seedance 2.0 为例,详细介绍了四模态(图、视频、音频、文本)的混合喂料方法,阐述了如何通过分别控制长相、运镜、情绪和剧情来提高出片稳定性。此外,文章推荐了 Edimakor 工具来实现从素材生成到后期缝合的工业化工作流。
文章旨在寻找无法被 Codex 等通用 AI 编程工具替代的 GitHub 开源项目。作者确立了包括多 Agent 编排、本地化设备操作、特定硬技能及隐私保护在内的筛选标准,精选并介绍了 CrewAI、AppAgent、F5-TTS、Stable-Diffusion-WebUI 等 20 款工具,强调了它们在复杂协作、隐私安全和特定垂直领域的独特价值。
文章探讨了如何利用豆包 Seed-2.0-lite 多模态大模型和 Agent 技术,将 Andrej Karpathy 两年前提出的“视频转博客”构想变为现实。作者通过将多模态能力封装为 Skill,并设计了一套包含视频切片、结构化素材提取、关键帧智能挑选和 Markdown 生成的四步工作流,成功解决了传统 ASR+LLM 流水线中信息丢失的问题,实现了高质量、图文并茂的技术博客自动化生成。
文章总结了吴恩达 AI 提示词工程课程第三模块的核心内容,聚焦于如何利用 AI 进行多模态任务。文章提炼了 6 节课程的精髓,包括:多模态成本意识、AI 看图与文字提取技巧、AI 绘画的视觉语言、用 Prompt 快速开发 App、以及利用 AI 写代码进行数据分析。文章提供了多个可直接复用的 Prompt 模板,如 GIO 三件套和数据提取四步法,旨在帮助用户找到让 AI 落地的最低成本路径。
文章总结了吴恩达2026年新课《AI Prompting for Everyone》,指出当前AI已从简单的聊天机器人进化为具备深度推理和多模态能力的工具。核心观点包括区分新手与高手的4大维度(问题难度、上下文、引导方式、写作流程)、利用3层信息架构解决知识局限、通过'渐进式大纲'避免AI废话,以及在推理时代如何运用评分卡和上下文工程来提升产出质量。
文章基于吴恩达 2026 年的新课《AI Prompting for Everyone》,总结了 AI 用法范式的四大迁移:处理复杂问题、提供海量上下文、避免盲目附和、采用渐进式工作流。内容涵盖 reasoning 时代的高阶提示技巧、利用 desktop app 的上下文管理、反 sycophancy 策略以及渐进式大纲写作法,旨在帮助用户掌握在推理时代驾驭 AI 的核心心法。
DeepSeek发布新论文,提出一种名为“视觉原语”的多模态推理框架。不同于业界卷分辨率的趋势,该模型通过在思维链中嵌入边界框和坐标点,模拟人类用手指着图片思考的过程,有效解决了语言在空间指代上的局限。DeepSeek-ViT配合LLM将视觉Token压缩至竞品的十分之一,但在空间推理、计数和迷宫导航等任务上性能超越GPT-5.4等顶尖模型。
文章详细解读了 DeepSeek 关于多模态推理的新论文。该研究提出一种“视觉原语”框架,让模型在推理过程中直接输出坐标和框,像人类用手指指物一样进行空间思考。这种方法仅用传统模型十分之一的视觉 Token,就在计数、拓扑推理等任务上达到了超越 GPT-5.4 和 Claude-Sonnet-4.6 的效果。文章还深入分析了模型在迷宫导航和路径追踪等任务上的数据合成与训练策略。
NVIDIA 发布了开源多模态大模型 Nemotron 3 Nano Omni。该模型集成了视觉、语音和语言能力,旨在解决 AI 智能体在处理不同模态数据时面临的延迟和上下文碎片化问题。凭借 30B-A3B 混合专家架构,其在开放模型中实现了领先的准确吞吐比(9倍于同类),可广泛用于计算机控制、文档智能及音视频理解等企业级场景。
文章探讨了如何让 LLM 理解和处理海量视频数据。作者指出单纯依赖上下文窗口并非最佳方案,因为成本高昂且无法进行确定性检索。借鉴编程中的 Unix 模式,文章提出构建“中间表示层”,提前提取并结构化对齐转录、视觉、情感等多模态数据,从而实现对视频内容类似 Grep 的高效搜索与组合分析。
文章揭示了 Seedance 2.0 的核心并非简单的文生视频,而是多模态电影片场。作者通过拆解上百条提示词,总结出“摄像机>风格>约束>主体>动作”的5层公式,并详解了如何利用时间编码和参考系统进行精准的镜头调度。
作者发布了名为 ImageToPrompt 的浏览器插件,该插件利用 Kimi 2.5 等多模态大模型分析图片并反向生成高质量生图提示词(含中文、英文及 JSON 格式)。文章详细介绍了插件的制作初衷、开发过程、在 Edge/Chrome 浏览器中的安装配置流程、API 设置方法以及实际测试效果,并提供了常见问题的解决方案。
文章详细记录了作者利用智谱新发布的开源模型 GLM-5 结合 OpenClaw 框架,从零搭建并定制化一个全能型 AI 女友的全过程。该项目不仅实现了基础的多模态情感陪伴(如发送基于生成的自拍、TTS 语音、看懂图片、主动提醒),更核心的是利用 GLM-5 强大的 Agent 规划与工具调用能力,赋予了 AI 女友操作服务器、执行任务和协作工作的“身体”与实战能力。
文章指出,未来的 AI 工程师将从简单的封装开发者转型为系统架构师。作者提出了 5 个按难度分级的生产级项目(从基于 SLM 的移动应用到自主企业工作流代理),旨在帮助开发者掌握编排、内存管理、多模态集成及深度上下文处理等核心技能,从而在 2026 年的市场中获得高薪竞争力。