Gemma4 选型指南:8个模型该选哪个? ✍ karminski-牙医🕐 2026-04-03📦 3.6 KB 🟢 已读 𝕏 文章列表 Google 发布 Gemma4 系列开放权重模型,本文为本地部署选型指南。文章解析了 '-it' 指令微调版与基版的区别,以及 E4B/E2B 移动端优化技术(Per-Layer Embeddings)的原理。针对不同场景推荐模型:本地对话选 26B-A4B(MoE 激活 4B);写代码选 31B;语音助手选 E4B;树莓派尝鲜选 E2B。 Gemma4本地部署模型选型GoogleMoE指令微调 # Gemma4有8个模型, 选哪个? 一文看懂! **作者**: karminski-牙医 **日期**: 2026-04-03T08:39:51.000Z **来源**: [https://x.com/karminski3/status/2039986222035067044](https://x.com/karminski3/status/2039986222035067044) ---  Google 刚刚发布了 Gemma4 系列开放权重模型, 之前没接触过本地模型的朋友都在问我该用哪个本地部署, 来, 这篇文让你迅无痛掌握.  首先啊, 选带"-it" 后缀的, 这个是指令微调版(Instruction Tuned) 的意思, 代表该模型经过了大规模的人类指令跟随训练和多轮对话对齐, 其他的都是基模, 是给自己要微调的同学准备的(所以举一反三, 你要是想自己微调, 就用不带-it的版本). A4B 我知道激活参数量是 4B, 那么 E4B 是啥意思? 简单来讲, 这是个专门为了移动端优化的技术——逐层嵌入(Per-Layer Embeddings), 它本身并不能省内存, 所以 Gemma-4-E2B 并不是它只需要2B参数量的内存, 它还是需要原始的5.1B的参数量的内存空间, 但是它的计算量只需要大概2B模型的计算量! (可以简单理解为把一部分矩阵运算优化为了查表, 然后用内存换计算了, 这部分表当然需要吃内存).  好的, 我们的前置知识准备完毕了! 那么接下来直接说模型选型:  本地龙虾优先选 Gemma-4-26B-A4B! 激活量4B的MoE, prefill速度也相当好, 特别适合龙虾这种系统提示词超级臃肿的场景.  写代码/写脚本/要求精确工作选 Gemma-4-31B, 选这个肯定就是要最好的效果的, 如果实在是跑不动, 可以试试5bit量化. 给大家一个参考, Apple M2Ultra 如果运行 8bit, 理论速度也就 25token/s.  我要一个本地语音助手! 选Gemma-4-E4B, 全模态输入, 你写代码让它接入有麦克风的摄像头, 剩下的场景就靠你的想象了. 并且4B激活即使CPU跑都能跑动.  我只想跑一下试试装在我的树莓派里, 选 Gemma-4-E2B, 你能体验到极致的本地模型速度, 至于质量嘛, 会比电子鹦鹉好点, 他可以做类似"帮我检查文本里有英文吗"之类的过滤工作, 另外它是全模态输入的, 也可以尝试语音输入.  #Gemma4 #google #GoogleGemma #本地大模型 ## 相关链接 - [karminski-牙医](https://x.com/karminski3) - [@karminski3](https://x.com/karminski3) - [11K](https://x.com/karminski3/status/2039986222035067044/analytics) - [#Gemma4](https://x.com/search?q=%23Gemma4&src=hashtag_click) - [#google](https://x.com/search?q=%23google&src=hashtag_click) - [#GoogleGemma](https://x.com/search?q=%23GoogleGemma&src=hashtag_click) - [#本地大模型](https://x.com/search?q=%23%E6%9C%AC%E5%9C%B0%E5%A4%A7%E6%A8%A1%E5%9E%8B&src=hashtag_click) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [4:39 PM · Apr 3, 2026](https://x.com/karminski3/status/2039986222035067044) - [11.4K Views](https://x.com/karminski3/status/2039986222035067044/analytics) - [View quotes](https://x.com/karminski3/status/2039986222035067044/quotes) --- *导出时间: 2026/4/3 20:11:04*
A AI开发工具新突破:Unsloth与Google Code Wiki 文章介绍了两项针对开发者的重磅AI工具更新。首先是Unsloth发布了指南,允许使用Gemma 4和Qwen3.6等开源模型,在24GB显存的本地机器上运行Claude Code的Agentic Coding工作流,实现了隐私、成本与交互体验的兼顾。其次是Google推出了Code Wiki,利用Gemini自动扫描GitHub仓库生成实时更新的智能Wiki,支持架构图生成和代码溯源,旨在解决软件开发中“读代码”的昂贵瓶颈。 技术 › DevOps ✍ Berryxia.AI🕐 2026-05-06 Claude CodeUnslothGoogle开源模型本地部署代码工具AI生产力DevOpsGemmaQwen
M Mapping the Brain with Connectomics 文章介绍了连接组学的发展历程及其在脑科学研究中的重要性。Google Research利用AI技术加速该领域研究,从1986年首次绘制线虫连接组,到2021年发布首个人类样本连接组图谱,未来还将完成果蝇和斑马鱼的全脑图谱。 技术 › AI工具 ✍ Google AI🕐 2026-07-30 连接组学脑科学GoogleAI神经图谱研究
我 我测试了5个声音克隆项目,最后留下了这一个 本文分享了作者在制作AI视频过程中,从使用MiniMax云端API转向本地部署IndexTTS2的实践经验。作者详细对比了两者在中英混排发音、音频格式、离线能力、声线一致性及成本等方面的优缺点,最终选择了IndexTTS2以保障视频工作流的可控性与稳定性。 技术 › TTS ✍ 雪踏乌云🕐 2026-07-29 声音克隆IndexTTS2MiniMax中英混排AI视频本地部署工作流音频处理
K Kimi K3 技术报告拆解:全球首个开源 3T 级模型 本文拆解了 Kimi K3 的技术报告,这是一个全球首个开源的 2.8 万亿参数模型。文章详细解析了其混合注意力架构、注意力残差机制、MoE 设计以及在长文本训练和推理优化上的创新。报告指出 K3 性能虽略逊于顶级闭源模型,但在多项任务中表现优异,且具有极高的成本效率,甚至已能辅助团队进行内核优化和芯片设计。 技术 › LLM ✍ Berryxia.AI🕐 2026-07-29 Kimi K3模型架构MoE长文本技术报告开源模型AI芯片内核优化推理加速
一 一个人的 AI 视频生产线:从 MiniMax 到本地声音克隆与数字人 文章详细记录了作者构建个人 AI 视频生产线的全过程。包括从 MiniMax 云端声音克隆迁移到本地 IndexTTS2 以降低成本和延迟,解决参考音频漂移问题;接入 HeyGen 数字人实现虚拟分身,并通过脚本自动化视频合成与人脸裁切。文章分享了具体的代码配置、生产流程(脚本、配音、字幕、合成)以及避坑指南,适合高频视频创作者参考。 技术 › 视频生成 ✍ 雪踏乌云🕐 2026-07-28 AI视频声音克隆IndexTTS2HeyGen数字人FFmpeg工作流Mac开发本地部署TTS
K K3 部署推理引擎指南 vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。 技术 › 后端 ✍ vLLM🕐 2026-07-28 vLLMKimi K3MoE推理引擎性能优化DSpark部署指南大模型基础设施
热 热门文字转语音 TTS 到底谁最强 文章评测了多款热门 TTS 工具:IndexTTS2 擅长情绪克隆,dots.tts 表现均衡,MiniMax 省心且速度快,GPT-SoVITS 最实用且门槛低。同时指出了 Qwen3-TTS 等工具的不足,并提供了本地部署的硬件建议。 技术 › TTS ✍ 柴郡|Crypto+AI Plus🕐 2026-07-24 TTS评测文字转语音IndexTTS2MiniMaxGPT-SoVITS本地部署情绪克隆工具推荐
开 开源神器Toonflow让小说秒变AI短剧 开源神器Toonflow可将小说或剧本快速转换为AI短剧,2小时内完成出片。工具支持自动编剧、分镜、角色设计和视频生成,采用三层Agent协作与本地记忆,跨平台本地部署,低成本高效。 技术 › 短剧 ✍ 开发者Hailey🕐 2026-07-23 AI短剧Toonflow开源视频生成Agent本地部署低成本
与 与杨植麟的第二次对话:站在无限的开端 本文是张小珺对月之暗面创始人杨植麟的第二次深度访谈,发生在Kimi K2模型发布后。文章深入探讨了AI如何通过编码能力突破“缸中之脑”,走向Agent与自我进化,以及杨植麟对技术挑战与创业心境的思考。 技术 › LLM ✍ 张小珺🕐 2026-07-22 杨植麟Kimi访谈Agent技术哲学DeepSeek自我进化创业MoEThe Beginning of Infinity
从 从 Kimi K3 看下一代 MoE 架构的转折点:LatentMoE 文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。 技术 › LLM ✍ 青稞社区🕐 2026-07-20 LatentMoEKimi K3MoE架构设计大模型NVIDIAMoonshot AI推理优化量化负载均衡
零 零成本 AI 生图,从安装到变现 文章探讨了在 MacBook Pro 上运行 ComfyUI 进行本地 AI 生图的实战经验。作者详细解析了潜空间扩散、提示词机制及模型工作原理,对比了 SDXL Turbo、FLUX 和 Qwen Image 等模型的优劣。文章提出了一套利用本地模型配合云端 API 的混合工作流,旨在低成本实现高质量出图,并介绍了商品场景图、封面配图等商业变现路径。 技术 › 生图 ✍ Miles.Ma🕐 2026-07-19 AI生图ComfyUIStable DiffusionFLUX本地部署工作流变现SDXLTurbo生图技巧
零 零成本 AI 生图,从安装到变现 本文探讨了在 MacBook Pro 上使用 ComfyUI 进行本地 AI 生图的经验。文章解析了 Stable Diffusion 的原理,指出模型决定上限、提示词指导方向、工作流保障稳定性。作者对比了本地模型(如 FLUX、Qwen Image)与云端 ChatGPT Images 2.0 的差异,并提出了混合工作流策略,最后分享了商品场景图、封面配图等变现路径。 技术 › AI应用 ✍ Miles.Ma🕐 2026-07-19 ComfyUIStable DiffusionFLUXAI生图本地部署工作流变现潜空间VAE图像模型