你用的中转到底是怎么运行的? ✍ 来碗牛肉粉, Sunny🕐 2026-04-24📦 11.3 KB 🟢 已读 𝕏 文章列表 本文深度拆解了 AI API 中转服务的运行原理,以开源网关 new-api 为例,详细阐述了从请求诞生到结果返回的全链路。文章涵盖了路由、鉴权、分发、转换、计费及容错等核心机制,并解析了渠道选择算法、流式传输及适配器模式等底层技术,揭示了中转站如何实现省钱、省事且稳定的 AI 服务调用。 LLM中转new-apiAPI网关计费系统架构设计OpenAIClaude渠道管理技术原理 # 你用的中转到底是怎么运行的? **作者**: 来碗牛肉粉 **日期**: 2026-04-24T10:21:27.000Z **来源**: [https://x.com/beefnoode/status/2047621937875362046](https://x.com/beefnoode/status/2047621937875362046) ---  > 你用 Claude Code、Cursor、Hermes 调用中转算力,背后的中转到底在干什么?本文从一个请求的诞生到结果返回,把整条链路进行深度拆解,帮你厘清中转相关的基础概念以及背后的底层逻辑。 > 作者: @beefnoode @0xenderzcx > 高质量AI算力,找BeefAPI就够了:https://beefapi.com/ 开始之前,先搞清楚几个概念 - API:一个程序给另一个程序用的接口。你的 Cursor 想让 CodeX 帮你写代码,就通过 OpenAI 的 API 发请求。 - API Key:形式为 sk-xxx 的密钥,相当于通行证。用谁的 Key 就扣谁的钱。 - 上游、供应商:真正提供 AI 服务的公司(OpenAI、Anthropic 等)。中转站就是介于你和上游之间的中间人。 - 渠道:中转站后台接入的上游账号或者API Key。 - Token:AI 计费的单位。老的 cl100k_base tokenizer 下大约 1 汉字 ≈ 2 token、1 英文单词 ≈ 1-2 token;GPT系列 新的 o200k_base 和 Claude 、Gemini 各自 tokenizer 差异很大,中文尤其省,因此不能一概而论。  关于中转,你需要知道的基础知识 ## 中转到底是什么? 中转就是分配和传输 AI 请求的中间人。你的工具(比如 Claude Code)不直接连接 OpenAI,而是连到中转站,中转站帮你给上游渠道转发请求。 举个特别形象的例子,通过中转使用AI的流程就像寄快递:你把包裹(请求)交给菜鸟驿站(中转),驿站选一个快递公司(上游渠道)帮你发,收件人(OpenAI)回复后驿站把包裹转交给你。 ## 那大家为什么需要中转? 省钱:中转站批量采购 账号或者上游的API 额度,你按量付费,不需要担心订阅套餐不够用或账号被风控封号 需要注意的是,便宜本质来自批量折扣、降价渠道或转售风险,部分中转会混用低质量渠道,省钱和稳定也是有 trade-off 的,因此选中转站时更加慎重,同时看清楚计费明细。 省事: 一个 API Key 用所有模型(GPT、Claude、Gemini),不用再去每家注册,省去繁琐流程 稳定:中转的渠道账号挂了自动切到下一个,用户端可持续稳定使用,你感知不到 ## 中转站的 4 个核心工作 - 路由:根据你用的模型,选一个可用的上游渠道 - 转换:你发 Claude 格式,上游是 OpenAI,中转帮你进行翻译 - 计费:记录你用了多少 token,扣你的余额 - 容错:一个渠道挂了,自动换另一个,维持整体的稳定性  基于 new-api ,进一步拆解中转底层原理 ## 架构总览 new-api 是一个用 Go 写的 开源 API 网关,核心设计是分层架构,一层叠一层,每层只做一件事: Router(路由)↓ Middleware(中间件,每个请求都要经过的检查关卡)↓ Controller(控制器,决定怎么处理)↓ Relay(转发层)↓ Adaptor(适配器,翻译不同厂商的格式)↓ Upstream(上游)  ## 第一层:路由(Router) 路由层定义了所有 API 端点,每个端点是一个固定的 URL 路径。new-api 兼容 OpenAI 的完整 API: - /v1/chat/completions - 聊天补全(最常用) - /v1/messages - Claude 原生格式 - /v1/responses - OpenAI Responses API - /v1/embeddings - 文本嵌入(把文字变成向量,用于相似度搜索) - /v1/images/generations - 图片生成 - /v1/audio/speech - 语音合成 另外还有 /mj/*(Midjourney)、/suno/*(Suno 音乐)这类异步任务型端点,走的是独立的任务提交 + 轮询路径。 ## 第二层:鉴权与分发(Middleware) 所有 /v1 请求会依次穿过这条中间件链,这个顺序很重要,也被讲经常错: CORS - 跨域检查 DecompressRequestMiddleware - 解压请求体 BodyStorageCleanup - 把请求体缓存到内存、磁盘,供后续重试时重放同一个请求(见下文) StatsMiddleware - 指标统计 SystemPerformanceCheck - 系统健康检查(过载时直接短路掉请求,早于鉴权,省掉一次数据库查询) TokenAuth - 校验你的 API Key(sk-xxx),确认身份和余额 ModelRequestRateLimit - 检查你是否超过了每分钟请求限制 Distribute - 最关键的中间件:解析你请求的模型,根据用户分组查找可用渠道,用加权随机算法选一个 > ⚠️ 网上常有文章把顺序写成"鉴权 → 健康检查 → 限速 → 分发"。实际代码里 SystemPerformanceCheck 在 TokenAuth 之前,这样系统过载时可以最快拒绝请求,不消耗用户查询。  在这个过程当中,以下这三个机制值得仔细聊聊 1、分组的多级匹配: 一次请求的分组不是单一字段,而是 Token.Group → User.Group → Channel.Group 三级匹配,再叠加 Channel.GroupRatio 倍率。这就是为什么同一个中转站里"VIP 分组更贵但走的渠道更稳"的底层原因。 2、渠道选择算法(model/channel_cache.go 的 GetRandomSatisfiedChannel): - 同一分组内,按 priority 降序分层 - 同一优先级内,按 weight 加权随机 - 当前优先级全挂了,retry 自增一层,降级到下一个优先级 - 本分组全用完,再切到下一分组 举个例子:你在 gpt-vip 分组,有 3 个渠道 - 渠道 A(优先级 0,权重 5)、渠道 B(优先级 0,权重 3)、渠道 C(优先级 1,权重 10)。先在 A 和 B 之间按 5:3 概率随机,两个都挂了才轮到 C。 3、渠道冷却机制: 失败的渠道不是永久摘掉,而是被标记"暂时不可用"并进入冷却窗口,窗口结束后自动恢复。这就是渠道挂了一会儿又回来了的原因。 ## 第三层:控制器(Controller)  控制器主要做 3 件事: 预扣费 - 根据 MaxTokens 配置(不是精确的 prompt token)估算一个上限,乘以模型倍率,先锁住一笔押金。对信任额度充足的老用户还有一条旁路,可以直接跳过预扣、走后置结算。 调用 Relay - 把请求交给转发层 结算- 拿到上游返回的真实 usage,计算差额,多退少补 预扣费是为了防止并发请求超额。你同时发 10 个请求,每个都会先锁住预估额度,避免余额用超了。 控制器也内置了重试逻辑,如果上游返回错误(比如 429 错误的意思就是 “请求太多了,慢点"),控制器会标记当前渠道临时不可用,切到同分组的下一个渠道,最多重试 N 次。 ## 第四层:转发层(Relay)  转发层是整个系统最复杂的部分。总入口是 controller.Relay(),它根据 RelayFormat 分发到不同的 handler: - TextHelper - OpenAI chat/completions 格式 - ClaudeHelper - Anthropic /v1/messages 格式 - ResponsesHelper - OpenAI Responses API - EmbeddingHelper / AudioHelper / ImageHelper / RerankHelper / GeminiHelper - 对应各自的 format 每个 handler 内部都做同一套事情:DTO(数据传输对象,就是把 JSON 变成结构化数据)解析 → 格式转换 → 参数覆盖 → 发送请求 → 解析响应 → 计费结算。 其中,流式传输机制(SSE)和用户体验息息相关。大部分 AI 请求是流式的,也就是服务器一边算一边往回反馈,不用等整个响应完成。new-api 用 StreamScannerHandler 实现实时转发,扫描器有 64KB-64MB 的自适应缓冲区,小的请求用小缓冲,长响应用大缓冲,能兜住超长推理链路不爆缓冲区。 ## 第五层:适配器(Adaptor)  New API架构下的适配器是插件化的,也就是说每个厂商一个独立插件,加新厂商不用改核心代码,这进一步提高了中转的可扩展性。每个上游供应商有一个独立的适配器,实现统一接口的同时还 40+ 个适配器:OpenAI、Anthropic Claude、Gemini、AWS Bedrock、Vertex、Azure、DeepSeek、Moonshot、智谱、xAI、Volcengine、Xinference、豆包、Jimeng 等等。 之前有朋友问,为什么Claude Code可以调用CodeX的模型,其实底层逻辑也是适配器和提式转换,我来举个例子:你用 Claude Code 发了一个 Anthropic 格式的请求到 /v1/messages,但分配到你头上的实际渠道是 OpenAI 的 GPT——适配器把 Anthropic 格式(system + messages + tool_use block)转成 OpenAI 格式(system message + messages + tool_calls),响应后再反向翻译回去,整个过程对你完全透明并且非常丝滑。你不需要关心上游到底是谁。 ## 计费系统  最后来聊聊计费系统,整个计费系统就两个核心组件: - 预扣:按 MaxTokens × 模型倍率估算上限,先锁住额度,防止并发超额。 - 结算:拿到上游返回的真实 usage,计算差额,多退少补。 定价支持按模型设倍率,倍率是运行时配置,不同中转站同一个模型的倍率不一样。举个例子:假设一个部署里 GPT-5.4 倍率 3.0、GPT-5.4-mini 倍率 0.3,那同样 1000 token,mini 就便宜 10 倍——具体数值以你用的中转站为准。 同时,用户每次请求都会写一条 logs 表记录,包含 prompt/completion token、倍率、使用的渠道 ID、耗时、错误码等字段。这是对账、账单申诉、异常追溯的第一手依据——这是判断一个中转站是否透明可信的重要维度。 总结 AI中转其实不神秘。它就是一个智能代理:帮你鉴权、选渠道、翻译格式、转发请求、计费结算、故障恢复。 而new-api这套开源框架,用分层架构 + 插件化适配器把这件事儿变成更加清晰、且易于可维护。 下次你再用中转写代码,你就知道AI 秒回的背后,是这条链路在默默工作。 The End. —— 来碗牛肉粉、Sunny PS:本文所有图片均为gpt-image-2 生成,效果非常惊艳、基本都是一次过,文字也非常清晰没有乱码!OpenAI牛逼! ## 相关链接 - [来碗牛肉粉](https://x.com/beefnoode) - [@beefnoode](https://x.com/beefnoode) - [332](https://x.com/beefnoode/status/2047621937875362046/analytics) - [@beefnoode](https://x.com/@beefnoode) - [@0xenderzcx](https://x.com/@0xenderzcx) - [https://beefapi.com/](https://beefapi.com/) - [Token.Group](https://token.group/) - [User.Group](https://user.group/) - [Channel.Group](https://channel.group/) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [6:21 PM · Apr 24, 2026](https://x.com/beefnoode/status/2047621937875362046) - [332 Views](https://x.com/beefnoode/status/2047621937875362046/analytics) - [View quotes](https://x.com/beefnoode/status/2047621937875362046/quotes) --- *导出时间: 2026/4/24 18:59:19*
H How to Build LLM Architectures From Scratch 本文是一篇关于从零构建大型语言模型(LLM)架构的深度指南。文章详细解释了 LLM 的工作原理,包括从原始数据收集、清洗、分词,到 Transformer 架构的核心组件(如自注意力机制、位置编码)。同时涵盖了预训练、微调、基于人类反馈的强化学习(RLHF)以及推理优化等关键技术环节,旨在帮助读者理解 ChatGPT 和 Claude 等模型背后的系统构建全流程。 技术 › LLM ✍ Shabnam Parveen🕐 2026-05-25 LLMTransformer架构设计RLHF深度学习人工智能模型训练OpenAIChatGPT技术原理
A Agent Harness 拆解:AI Agent 的工程化基础设施 本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。 技术 › Harness Engineering ✍ 土豆本豆🕐 2026-05-21 AgentHarnessLLM架构设计LangChainClaudeOpenAI上下文管理工程化Agent拆解
代 代理工具的解剖结构 文章深入剖析了将无状态 LLM 转变为功能强大的智能体所需的“代理框架”基础设施。内容涵盖编排循环、工具工程、内存、上下文管理、安全护栏及子代理编排等 12 个核心组件。文章对比了 Anthropic、OpenAI 和 LangChain 的实现策略,指出生产级应用的关键在于模型周围的工程架构,而非模型本身。 技术 › Agent ✍ Akshay🕐 2026-04-07 AgentLLM架构设计OpenAILangChainClaude工程化上下文管理工具调用多智能体
H How to master graph engineering 本课程教授如何构建 AI 智能体图,涵盖图的基本概念、关键模式(如菱形模式)、停止规则及人工审批环节。包含三个实战案例:深度研究台、SEO 内容生成器和市场推广套件,旨在提升业务效率并控制成本。 技术 › Agent ✍ Machina🕐 2026-07-23 AgentGraphLLMClaudeWorkflow工程化自动化架构设计效率实战
什 什么是图工程及其走红原因解析 文章解释了从“循环工程”到“图工程”的技术演进。循环是简单的单一代理执行模式,而图(由节点、边和状态组成)通过可视化的流程图处理复杂逻辑和多代理协作。文章介绍了如何使用 LangGraph 构建第一个图,并指出在逻辑变得复杂时应从循环升级到图。 技术 › Agent ✍ Alex Martin🕐 2026-07-21 Graph EngineeringLangGraphAgentLoopsLLMClaudeOpenAI教程
C Claude Code Dynamic Workflows:把编排逻辑搬进代码的新原语 Anthropic 推出的 Claude Opus 4.8 引入了 Dynamic Workflows 功能,旨在解决大型代码库迁移和复杂任务编排的难题。该功能通过将编排过程生成本地 JavaScript 脚本,利用运行时管理逻辑,突破了传统 Agent 上下文窗口的限制,实现了对海量并行任务的高效处理。文章详细解析了其与 Subagent 和 Agent Teams 的区别、核心架构、脚本编写规范以及触发机制。 技术 › Claude ✍ riba2534🕐 2026-05-30 ClaudeClaude CodeDynamic WorkflowsAgentLLM架构设计开发工具自动化
2 2026年AI用户必知的12层架构:构建可靠的AI智能体 文章提出了AI智能体的12层架构模型,旨在帮助用户理解AI工具的工作原理及失效原因。内容分为三部分:基础层(工作界面、智能体合约/规范、模型)、运行层(运行时状态、工具互操作性、执行表面)以及记忆与知识层。文章强调,只有理解了这些层级(如MCP协议、Agent间协作、多级记忆系统等),才能解决AI输出不稳定、工具选择困难及信任缺失等问题,从而将AI从演示带入实际工作流。 技术 › Agent ✍ Vox🕐 2026-05-24 AI架构智能体MCP协议系统设计方法论A2ALLMClaudeOpenAI技术指南
C Codex CLI 内存机制详解 文章深入解析了 OpenAI Codex CLI 的内存架构,该工具通过本地 Markdown 文件异步生成和汇总记忆。文章详细介绍了记忆的写入与加载流程,指出其缺乏向量数据库、仅依赖关键词匹配及受限于本地文件系统等局限。最后,文章引入 Mem0 作为解决方案,通过 MCP 协议提供跨机器、跨工具的持久化智能记忆层,解决原生功能在扩展性和同步方面的不足。 技术 › OpenAI ✍ mem0🕐 2026-05-14 CodexCli内存管理MCPAgentMem0架构设计开发工具OpenAILLM
深 深度拆解:AI Agent Harness 的构造 文章深入探讨了“AI Agent Harness”的概念,即包裹在大语言模型之外、使其转变为智能体的完整软件架构。作者详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、工具、记忆、上下文管理等),对比了 Anthropic、OpenAI 和 LangChain 的不同实现路径,并指出 Harness 工程是决定 AI 应用性能的关键。 技术 › Harness Engineering ✍ 宝玉🕐 2026-05-12 AI AgentLLMHarness架构设计OpenAIAnthropicLangChain工程化
2 2026年真正学习AI的7个开源仓库 这是一份2026年AI学习资源清单,包含7个精选的GitHub开源仓库。内容覆盖从初学者指南到高级LLM路线图,包括微软的GenAI课程、从零构建ChatGPT的PyTorch教程、Karpathy的nanoGPT训练、OpenAI与Anthropic的实战Cookbook以及AI Agents构建指南。所有资源均免费,旨在帮助学习者掌握Prompt、RAG、微调及Agent等核心技术。 技术 › LLM ✍ self.dll🕐 2026-05-06 AILLM学习资源GitHubOpenAIClaudeAgent教程开源模型训练
O OpenAI Agent SDK 解析:Harness/Compute 分离架构 文章详细解读了 OpenAI Agents SDK 的新架构设计,即 Harness(可信层)与 Compute(计算层)分离模式。该架构将凭证管理与代码执行隔离,不仅解决了长时程 Agent 的安全与稳定性痛点,还实现了状态持久化、跨平台部署及简易审计,被视为企业级 Agent 开发的教科书级设计。 技术 › Agent ✍ 烟花老师🕐 2026-05-06 OpenAIAgentSDK架构设计安全隔离沙箱LLM开发工具Harness Engineering
解 解剖 Skill:Skill 工程化实战指南(二) 文章深入剖析了 AI 编程中 Skill 的内部结构与生命周期。作者指出 Skill 不仅是高级 Prompt,而是包含元数据、入参结构、核心提示词及执行器的标准件。文章详细解释了 Skill 从注册发现到意图匹配再到沙盒执行的全过程,并提出了判断何时封装 Skill 的三个标准,旨在帮助开发者通过工程化手段稳定 AI 输出。 技术 › Skill ✍ 老金🕐 2026-04-30 AI工程化LLMClaude CodeSkill代码审查Agent开发工具技术原理架构设计Schema