魔芋AI 旗下 · 企业级大模型网关 当 GPT、Claude、文心、通义、GLM、Llama……同时涌入企业,缺的不是一个好模型,而是一扇能纳管所有模型、智能调度、降本控险的“大模型网关”。
|
|
|
|
产品全称
|
MAIGateway(魔芋企业 AI 网关)
|
|
产品定位
|
企业大模型 API 的统一入口与治理层
|
|
开发主体
|
武汉市魔芋数字有限公司 · 奇墨科技有限公司
|
|
官方网站
|
https://mai.moyu.cn/
|
|
客服热线
|
4008-233-655
|
|
核心特性
|
私有化部署 · 200+ 全模态模型纳管 · 智能路由降级 · Token 计量分账 · 等保三级
|
大模型正在从“试一试”走向“规模化运营”。当企业同时接入多家供应商、多种开源模型与自研模型,传统的“各应用直连各模型”方式会迅速失控——接口碎片化、密钥裸奔、成本黑盒、模型切换困难、智能体异常消耗。MAIGateway 是魔芋AI推出的企业级大模型网关,把企业内外所有大模型 API 收口到统一入口,让每一次模型调用都可纳管、可调度、可计量、可降级、可审计。
一、大模型网关是什么
大模型网关是企业所有大模型 API 的统一入口与治理层。它面向企业规模化使用大模型时的接入、管理与治理需求,提供模型接入、组织权限、令牌与配额、流量调度、成本核算、安全防护、日志审计与运行监控等功能。产品支持私有化本地部署,可连接公共大模型 API、企业私有模型以及本地或云端 GPU 算力。
与传统 API 网关不同,大模型网关的治理对象是以 Token 计量、按调用持续发生费用的大模型调用——这意味着它不仅要转发请求,还要懂模型、懂链路、懂成本、懂内容安全。MAIGateway 把一次大模型调用拆分为完整流水线:
在魔芋AI 的产品体系中,MAIGateway 侧重企业内部的大模型调用治理、API 服务的精准分账和成本优化;魔芋AI MaaS 侧重模型服务供给。两者可组合使用,也可分别接入企业已有的模型平台、私有模型或第三方模型服务。
二、为什么需要大模型网关
企业接入大模型时,通常面临五类大模型特有的新挑战:
-
多模型分散,难以统一——GPT、Claude、文心、通义、GLM、Llama 散落在各团队,应用需分别适配接口,模型更换或供应商异常时业务逐个调整。
-
模型切换困难,被厂商绑定——业务代码硬编码模型与 Key,想从 A 模型切到 B 模型,需改代码、改 Key、改参数,迁移成本高。
-
Token 计量,成本黑盒——大模型按 Token 计费,与传统云资源消耗迥异。财务只看到总额,无法判断费用由哪个部门、项目或智能体产生。
-
智能体异常消耗失控——自动化智能体可能因循环调用、异常重试或上下文不断累积持续烧 Token,月末才发现超预算。
-
高并发与故障无防护——模型供应商限流、超时、宕机时,业务直接报错;缺少熔断降级与故障转移,关键业务可能掉线。
大模型网关要解决的,正是把“调一次大模型”这件事变成一条可治理、可降本、可容灾的流水线。
三、大模型网关七大核心能力
1. 多模型统一纳管
集中纳管魔芋AI 模型服务、第三方大模型 API(GPT、Claude、Gemini、文心、通义、GLM 等)、企业私有模型与开源自建模型(Llama、Qwen、Mistral 等),统一维护模型名称、版本、供应商、接口参数、启停状态与价格,覆盖 200+ 全模态模型能力。模型目录可按组织、项目或角色设置可见范围,企业可限制某部门只用指定模型。
2. 智能路由与故障降级 ⭐
大模型网关的“调度大脑”:
-
跨模型调度:A 模型超时/报错,自动降级到 B 模型,关键业务永不掉线。
系统定期检查模型链路状态,超时、连续报错或不可用时临时下线,恢复后重新加入路由,毫秒级故障转移,可用性超 99.9%。缓存与上下文处理可减少重复请求及冗余 Token。
3. Token 计量与 FinAPI 成本治理
FinAPI 是 MAIGateway 中的大模型费用管理框架,管理对象是以 API 和 Token 形式持续发生的模型调用成本。系统记录输入 Token、输出 Token、模型单价、责任主体与调用时间,可按供应商、模型、部门、项目、用户或令牌形成费用明细。成本管理分三阶段:
统一管理(收口分散采购与调用)→ 成本审计(预算/账单核对/异常识别/费用归因)→ 成本优化(按业务价值调整路由、缓存、上下文与模型选择)
形成预算—告警—归集—优化的持续闭环,可协助企业降低 20%~70% 的模型调用成本(具体比例需在场景中测量)。
4. 令牌全生命周期管理
企业应用和用户通过受控令牌调用大模型,而非直接持有供应商 Key。网关记录令牌的创建、绑定、授权、使用、轮换、撤销与失效状态,可设置有效期、模型范围、调用频率及 IP 黑白名单。人员离职、项目结束或检测到异常高频调用时,可一键撤销,令牌操作进入审计日志。
5. 配额与流量控制
配额可按企业、组织、部门、项目、用户、令牌或模型设置,周期按日/周/月,控制指标可为金额、Token 数、请求频率或并发数。自动化智能体可单独配置 RPM、TPM 与最大费用,避免循环调用持续消耗资源;额度接近阈值告警,超限后按规则限速、阻断、临时扩容或模型降级。
6. 大模型内容安全防护
-
输入侧:检测提示词注入,识别手机号、身份证号、银行卡号等 PII 并按策略脱敏、阻断或放行;
-
输出侧:模型返回内容经内容检测,对命中规则的结果过滤或替换为安全话术;
-
传输与密钥:TLS 加密,外部模型密钥由网关集中保管,内部应用只用企业令牌。
7. 全链路监控与审计
实时追踪每次请求的链路、延迟、错误率与 Token 消耗;模型不可用、调用量突增、预算超限、令牌异常或内容安全事件触发多渠道告警(邮件/钉钉/飞书)。全程保留 API 请求、响应状态、调用模型、路由链路、Token 消耗与责任主体日志,可追溯、可审计。
四、大模型调度策略一览
|
策略
|
适用场景
|
行为
|
|
默认路由
|
多供应商负载分担
|
按权重分配流量
|
|
主备路由
|
关键业务高可用
|
主链路异常自动切备用
|
|
成本路由
|
降本导向
|
符合条件的任务走低价模型
|
|
优先级路由
|
业务分级
|
按业务优先级选模型
|
|
跨模型降级
|
容灾
|
A 模型故障自动切 B 模型
|
|
健康检查
|
链路保活
|
超时/连续报错临时下线,恢复后回归
|
五、产品矩阵:G / S 系列
软件版本
-
标准版:模型聚合、基础路由、用量统计、令牌与配额管理。
-
企业版:增加组织、角色、项目、预算、分账、安全及审计能力。
-
旗舰版:面向多集群与定制场景,支持更复杂的路由、缓存、跨区域调度与数据分析。
软硬件一体机
-
G 系列 · 软件网关:不配置本地 GPU,主要处理公共模型 API 与企业已有模型服务的接入、路由、费用与安全管理。可单机、双机热备或集群部署。
-
S 系列 · 硬件网关:配置本地算力,在网关治理功能之上接入本地 GPU 与开源模型,适用于对数据本地处理或本地推理有要求的场景。
六、与同类方案的区别
|
维度
|
MAIGateway
|
通用模型聚合网关
|
云厂商大模型平台
|
|
设计目标
|
企业内部大模型调用治理
|
渠道接入/转发计费
|
平台内闭环
|
|
模型纳管
|
自研+开源+第三方全纳管
|
以转发为主
|
偏自家模型,第三方有限
|
|
组织权限
|
同步钉钉/飞书/企微/AD,项目隔离
|
用户管理为主
|
依赖自家 IdP
|
|
成本治理
|
FinAPI 预算-分账-归因-优化
|
计费为主
|
账单为主,归因弱
|
|
智能路由降级
|
多链路+跨模型降级+故障转移
|
弱
|
路由能力有限
|
|
内容安全
|
输入脱敏+输出过滤
|
无
|
部分
|
|
部署
|
私有化/混合/等保三级
|
多为 SaaS
|
公有云绑定
|
七、典型大模型应用场景
-
多团队、多模型统一接入:不同团队分别采购模型时,将接口和密钥收口到统一网关,应用使用稳定的企业地址和令牌,供应商变更在网关侧处理。
-
自动化智能体异常消耗治理:为智能体单独建立项目,设置 RPM、TPM、预算与熔断策略,调用突增或费用接近阈值时通知责任人。
-
财务分账与月度对账:费用按部门、项目、人员和令牌归集,财务从费用中心查看明细并与供应商账单核对。
-
敏感数据调用外部模型:请求发往外部模型前识别个人信息或内部敏感字段,按规则脱敏、阻断或转向本地模型。
-
公共模型与本地算力混合使用:同时管理公共模型 API、私有模型与本地 GPU,按数据等级、成本、延迟与模型能力选择链路。
-
企业内容生成:文本、图片、视频生成任务在统一身份、配额与资产记录下运行,安全策略检查输入输出内容。
八、部署与安全合规
MAIGateway 支持私有化与混合部署:在企业数据中心、私有云或指定云环境部署,应用访问网关地址,网关再连接公共模型、私有模型或本地推理服务。
-
单机部署:网关、MySQL、Redis 同机,适合调用规模小、运维简单的场景。
-
集群部署:负载均衡后多无状态实例,共享数据库/缓存/日志,以峰值在途请求数为容量规划主指标。
-
混合部署:普通任务走公共模型,敏感数据/本地能力任务路由到私有模型。
平台基于等保三级完成信息安全建设并通过评测,全程 TLS 加密传输,留存全链路请求与响应日志,满足《数据安全法》等监管要求。
注:等保、数据安全、认证与行业合规结论,以具体产品版本、部署环境及正式证明文件为准。
联系方式
让企业接入的每一个大模型,都可见、可控、可计量、可降级。