榫卯® AI 平台

让构建 AI 就绪的基础设施更简单

面向企业 AI 应用从验证走向生产,榫卯 AI 平台帮助用户在统一基础设施上完成算力管理、模型部署、调用治理与持续运维,加快 AI 能力接入业务场景。

概览导入 YAML导出 YAMLadmin
集群3
推理实例11
ClusterAllLast 1 hour30s
Nodes5
GPU4
GPU avg37%
GPU memory51.0%
Current QPS128req/s
Avg latency0.42s
CPU avg3.57%
Memory avg11.8%

GPU inventory by model

ModelTotalFree
NVIDIA L2021
Tesla T421

Cluster utilization

60%45%30%15%0%
10:3010:4511:0011:1511:30
CPUMemoryGPUGPU memory
了解产品
产品价值
产品特性
生产级基础设施
成功案例
更多资源
了解产品

面向企业 AI 推理与模型服务场景的基础设施平台

榫卯 AI 平台是一款面向企业 AI 推理与模型服务场景 的基础设施平台,支持在本地环境中统一管理异构算力资源、多类型模型资产和模型调用入口,帮助企业更安全、高效地构建可管理、可治理、可观测的 AI 服务底座。

平台采用灵活兼容的架构,可适配物理机、虚拟机、Kubernetes 等多种运行环境,以及 NVIDIA、昇腾、AMD、Intel 等多类 AI 芯片。通过模型仓库、推理引擎、模型网关、资源调度、权限治理和可观测能力,榫卯 AI 平台帮助企业降低模型部署与算力管理复杂度,加快 AI 应用从验证走向生产。

榫卯 AI 平台能力
算力管理模型管理模型仓库模型目录模型网关可观测性
AI 芯片
NVIDIAGPU
昇腾NPU
AMDGPU
IntelGPU
运行环境
物理机
虚拟机
Kubernetes
产品价值

为何选择榫卯 AI 平台

统一纳管,模型 Day-1 快速上线

开放架构统一纳管物理机、虚拟化、容器等多种环境下的异构算力,屏蔽底层差异,对各类模型集中管理;平台 1 天完成部署、模型 Day-1 快速上线。

提升资源利用率,降低 AI 建设成本

平台灵活开放,支持部署在任意位置、兼容各类工作负载,可充分复用已有基础设施、减少重复投入;模型统一供给,可充分复用;结合 GPU 虚拟化与按显存/算力粒度切分,让 GPU 资源更精细、更高效地使用。

强化模型治理,实现精细化运营

平台原生内置模型网关,统一提供用量统计、Tokens 配额、调用日志与访问控制,让模型使用可见、可控、可审计、可量化运营。

生产级底座,稳定承载推理服务

推理服务支持多副本高可用、负载均衡与原生 KV Cache offloading,依托生产级容器与存储底座、统一监控与日志体系,提供轻量、稳定、可观测的生产级推理服务,保障业务持续稳定运行。

产品特性

统一纳管异构 AI 算力,
提升资源利用率与管理效率

榫卯 AI 平台集群详情界面,集中展示集群 CPU、内存、卡数与显存用量,以及各节点和 GPU 的运行状态
统一纳管异构 AI 算力, 提升资源利用率与管理效率
  • 多环境算力统一纳管

    支持将物理机、虚拟机和 Kubernetes 集群中的 AI 算力统一纳入平台管理,屏蔽底层环境差异,实现资源统一调度、监控与分配。

  • 多类型 AI 芯片统一管理

    支持 NVIDIA、昇腾、AMD、Intel 等异构 AI 芯片,覆盖 GPU、NPU 等多类算力资源。平台可统一纳管企业已有和新建算力资源,帮助减少重复建设,提升基础设施复用率,同时满足国产化和异构算力建设需求。

  • 算力资源弹性编排

    支持 NVIDIA GPU、昇腾 NPU 等异构算力资源的动态切分与整卡直通,可根据模型规模与性能需求灵活分配显存和算力:大模型推理采用整卡直通,保障性能与吞吐稳定;OCR、ASR、Embedding、Rerank 等轻量模型通过资源切分共享算力,在同一平台兼顾性能、资源利用率与成本控制。

统一交付多类型模型,
加快模型从验证到上线

推理实例列表界面
多类模型统一纳管

多类模型统一纳管

支持大语言模型、多模态模型、Embedding、Rerank、视觉模型等统一管理,并通过 Flex Engine 扩展支持 MinerU、PaddleOCR 及部分机器学习模型,在同一平台完成语言、视觉、文档解析、OCR 和机器学习模型等多类模型资产的部署、发布和调用。

模型网关与治理,
让模型调用看得清、管得细、控得住、追得到

私有模型与公有模型经统一入口访问的示意图
内外部模型统一入口

内外部模型统一入口

通过统一模型网关接入私有模型、公有模型和其他外部模型 API,为不同业务应用提供一致的模型调用入口。应用侧可通过统一接口调用不同模型,减少因模型变更带来的调用地址、鉴权方式和接入配置调整。

统一运维与全链路可观测,
提升推理服务运行效率

推理实例监控的延迟面板,展示 E2E、TTFT、TPOT、ITL 的 P95 指标卡与 P50–P99 延迟趋势曲线
模型服务运行状态可观测

模型服务运行状态可观测

支持查看推理实例健康状态、实时日志、TTFT、TPOT、E2E 延迟、吞吐、队列和 KV Cache 使用情况,帮助平台团队快速定位模型服务性能瓶颈和运行异常。

生产级基础设施

构建生产级 AI 推理
基础设施

榫卯 AI 平台是榫卯企业云基础设施面向 AI 推理场景的重要组件,聚焦算力模型管理、模型治理和高性能推理,并可结合榫卯企业云平台提供的容器、存储、网络、安全和可观测能力协同,为企业构建生产级、高性能、可治理的模型推理基础设施。

榫卯® AI 平台
榫卯®企业云平台
容器服务

为模型推理服务提供标准化运行时环境,支持 GPU 驱动管理,并结合高性能网络能力,保障推理实例稳定运行和高效调度。

存储服务

为模型文件提供可共享、可管理的存储能力,减少重复存储和分发;同时可为 KV Cache 提供高性能、高容量的缓存与持久化支撑。

可观测能力

覆盖 GPU 硬件状态、容器运行状态、推理实例健康、模型资源消耗、调用日志、Token 用量和链路延迟等关键环节,形成全链路可观测能力,帮助企业快速定位问题、开展安全审计、评估服务性能并持续优化资源使用效率。

成功案例

不同场景下的 AI 基础设施落地实践

大型船舶工程公司智能体与模型完整支撑体系案例配图
智能体运行 + 模型服务制造

大型船舶工程公司构建智能体(Agent)与模型完整支撑体系

榫卯企业云平台 / 榫卯 AI 平台

在榫卯企业云平台上统一支撑内部规范查询助手、翻译、运维等智能体应用,通过 AI 平台实现内部已有模型与自建模型的统一管理与治理。

三级甲等��综合性医院统一模型即服务平台案例配图
模型服务医疗

三级甲等综合性医院构建统一模型即服务平台

榫卯 AI 平台

基于榫卯 AI 平台实现算力和模型的统一管理,支撑各类 AI 应用。

三级甲等综合性医院算力资源和模型资源统一交付案例配图
算力与模型统一交付医疗

三级甲等综合性医院实现算力资源和模型资源的统一交付,满足不同类型模型的运行需求。

榫卯企业云平台 / 榫卯 AI 平台

基于榫卯企业云平台提供算力资源,支撑视频识别小模型,通过榫卯 AI 平台实现大语言模型的统一管理。