小互 IP Studio:我开源了 AI 自动配图技能,还附赠 31 个现成角色
作者宣布开源“小互 IP Studio”配图技能。该工具能自动读取文章并规划、生成配图,核心特色是提供 31 个现成的原创 IP 角色(涵盖职场与情绪梗)及多种画风,解决了用户无 IP 形象的痛点。技能支持 Agent 安装,仅需自然语言指令即可完成配图,并包含一套防止 AI 生成翻车的严谨方法论。
作者宣布开源“小互 IP Studio”配图技能。该工具能自动读取文章并规划、生成配图,核心特色是提供 31 个现成的原创 IP 角色(涵盖职场与情绪梗)及多种画风,解决了用户无 IP 形象的痛点。技能支持 Agent 安装,仅需自然语言指令即可完成配图,并包含一套防止 AI 生成翻车的严谨方法论。
TRAE 举办“AI 创造力大赛”,奖金总额高达 100 万元。比赛不限编程基础,聚焦生活化场景(如生活娱乐、学习工作等),鼓励利用 Vibe Coding 实现创意。决赛保底 1 万元,冠军 30 万元,且 Token 消耗由赛事方承担。
作者开源了其使用半年的视频翻译工具,支持通过自然语言指令一键完成视频的下载、转写、翻译、润色及烧字幕工作。该工具基于本地 Whisper 模型实现免费离线转写,复用用户已有的 AI 接口进行翻译,并针对字幕时间轴准确性和断句润色进行了深度优化。
Anthropic 分享了如何利用 Claude 将数据分析准确率从 21% 提升至 95%,并自动完成 95% 的业务查询。文章详细介绍了其构建的四层智能体分析栈:数据基础、权威来源、技能(Skills)和验证机制。通过规范数据集、强制语义层使用、编写 Markdown 技能文件以及严格的离线与线上评估,Anthropic 解决了概念歧义、数据过时和信息检索困难三大问题,成功将重复性分析工作交给 AI,让数据科学家专注于高价值建模。
OpenAI 发布 Codex 重大更新,推出六个面向职业角色(如数据分析、销售、投行等)的专属插件,捆绑 62 个应用和 110 个自动化技能。同时上线 Sites 功能,可直接生成交互式网页应用,并新增 Annotations 精准编辑功能。Codex 非开发者用户占比已达 20%,正试图从单一编码工具转型为全能办公调度层,直接威胁依靠“界面好用”作为护城河的中间层 SaaS 工具。
Koji 是一款由麻省理工和哈佛专家打造的 AI 私教应用,其核心理念是拒绝直接提供答案,而是通过引导逼学生思考。它具备屏幕感知与图形化交互能力,能实时高亮、批注屏幕内容,并通过反问、画图等方式(如在几何题中标点、在 Python 课中提示死循环)提供指导。Koji 旨在解决传统 AI 剥夺学习机会的问题,降低提问门槛,重点培养学生的理解与纠错能力。
ElevenLabs 发布全新 Dubbing V2 端到端 AI 配音模型。该模型摒弃了传统的“转写-翻译-合成”三段式流程,直接基于原始表演进行声音建模。它支持 90 多种语言和口音,能完美保留原说话人的音色、情绪、呼吸节奏及身份特征,实现音色穿越和情绪保真。同时支持音频、视频及文字输入,提供限时免费体验。
文章介绍了 Rodin 3D 生成模型的工作流程与新功能。该模型采用非一步生成模式,先出高精度初版,经用户确认后提供轻量版本(支持动画与游戏引擎格式)。此外,Rodin 支持自定义参数预设以简化操作,并具备最高并行生成 10 款模型的能力,实现了大规模创意探索。官方提及该模型拥有 1000 万多边形面数及自适应思维投入。
本文记录了 xAI 全员大会的详细内容,展示了公司在成立仅两年半后,在语音、图像生成和预测能力上取得第一的成绩。马斯克披露了四大产品线(Grok、Coding、Imagine、Macro Hard)的组织架构调整,并详细阐述了从 10 万块 GPU 扩展到 100 万块的技术基础设施与 Memphis 超级计算中心的惊人建设速度。