搜索_华为云

调用ModelArts Studio（MaaS）部署的模型服务 - AI开发平台ModelArts

调用ModelArts Studio（MaaS）部署的模型服务在ModelArts Studio大模型即服务平台部署成功的模型服务支持在其他业务环境中调用。本文以我的服务为例，调用部署的模型服务。您也可以调用预置服务-免费服务、预置服务-商用服务或预置服务-自定义接入点。场景描述在企业AI应

 帮助中心 > AI开发平台ModelArts > ModelArts Studio（MaaS）用户指南 > ModelArts Studio（MaaS）在线推理服务
查询服务监控信息 - AI开发平台ModelArts

service_running_instance_count Integer 服务运行中实例数量。 service_instance_count Integer 服务实例数量。 req_count_per_min Long 服务分钟调用量，这里指当前时间上一分钟的服务调用总量。表5 Monitor 参数参数类型

 帮助中心 > AI开发平台ModelArts > API参考 > 服务管理
查询推理服务标签 - AI开发平台ModelArts

查询推理服务标签功能介绍查询当前项目下的推理服务标签，默认查询所有工作空间，无权限不返回标签数据。调试您可以在API Explorer中调试该接口，支持自动认证鉴权。API Explorer可以自动生成SDK代码示例，并提供SDK代码示例调试功能。 URI GET /v1

帮助中心 > AI开发平台ModelArts > API参考 > 服务管理
查看在线服务详情 - AI开发平台ModelArts

查看在线服务详情当模型部署为在线服务成功后，您可以进入“在线服务”页面，来查看服务详情。登录ModelArts管理控制台，在左侧菜单栏中选择“模型部署 > 在线服务”，进入“在线服务”管理页面。单击目标服务名称，进入服务详情页面。您可以查看服务的“名称”、“状态”等信息，详情说明请参见表1。

帮助中心 > AI开发平台ModelArts > ModelArts Standard用户指南 > 使用ModelArts Standard部署模型并推理预测 > 管理同步在线服务
查看批量服务详情 - AI开发平台ModelArts

表1 批量服务参数参数说明名称批量服务名称。服务ID 批量服务的ID。状态批量服务当前状态。任务ID 批量服务的任务ID。实例规格批量服务的节点规格。实例数批量服务的节点个数。任务开始时间本次批量服务的任务开始时间。环境变量批量服务创建时填写的环境变量。

帮助中心 > AI开发平台ModelArts > ModelArts Standard用户指南 > 使用ModelArts Standard部署模型并推理预测 > 管理批量推理作业
管理同步在线服务 - AI开发平台ModelArts

管理同步在线服务查看在线服务详情查看在线服务的事件管理在线服务生命周期修改在线服务配置在云监控平台查看在线服务性能指标集成在线服务API至生产环境中应用设置在线服务故障自动重启父主题：使用ModelArts Standard部署模型并推理预测

 帮助中心 > AI开发平台ModelArts > ModelArts Standard用户指南 > 使用ModelArts Standard部署模型并推理预测
升级推理服务（可选） - 基于KubeInfer的推理部署 - AI开发平台ModelArts

升级推理服务（可选）针对该场景，可以直接编辑k8s配置，通过修改镜像、启动命令等参数来升级推理服务。注意提前进行导流或限流措施，以免升级过程影响整体业务。其中默认升级策略详见基于KubeInfer的部署yaml文件说明，命令如下： kubectl get kubeinfer kubectl

帮助中心 > AI开发平台ModelArts > 最佳实践 > DeepSeek基于Lite Server&Cluster推理 > DeepSeek模型基于ModelArts Lite Cluster适配NPU的PD分离推理解决方案 > 基于KubeInfer的推理部署
升级推理服务（可选） - 基于KubeInfer的推理部署 - AI开发平台ModelArts

升级推理服务（可选）针对该场景，可以直接编辑k8s配置，通过修改镜像、启动命令等参数来升级推理服务。注意提前进行导流或限流措施，以免升级过程影响整体业务。其中默认升级策略详见基于KubeInfer的部署yaml文件说明，命令如下。 kubectl get kubeinfer kubectl

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > Qwen3模型基于ModelArts Lite Cluster适配Snt9b23的混部推理解决方案 > 基于KubeInfer的推理部署
升级推理服务（可选） - 基于KubeInfer的推理部署 - AI开发平台ModelArts

升级推理服务（可选）针对该场景，可以直接编辑k8s配置，通过修改镜像、启动命令等参数来升级推理服务。注意提前进行导流或限流措施，以免升级过程影响整体业务。其中默认升级策略详见基于KubeInfer的部署yaml文件说明，命令如下： kubectl get kubeinfer kubectl

帮助中心 > AI开发平台ModelArts > 最佳实践 > DeepSeek基于Lite Server&Cluster推理 > DeepSeek模型基于ModelArts Lite Server适配NPU的PD分离推理解决方案 > 基于KubeInfer的推理部署
推理服务精度评测 - 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.5.902） - AI开发平台ModelArts

ASCEND_RT_VISIBLE_DEVICES：表示支持多个模型服务实例，同时支持模型并行，如 0,1:2,3，以冒号切分，表示0卡和1卡跑一个模型服务实例，2卡和3卡跑一个模型服务实例。默认为0卡只跑一个模型服务实例。 QUANTIZATION：为量化选项，不传入默认为None

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.5.902）
推理服务精度评测 - 主流开源大模型基于Lite Server&Cluster适配Ascend-vLLM PyTorch NPU推理指导（6.5.905） - AI开发平台ModelArts

ASCEND_RT_VISIBLE_DEVICES：表示支持多个模型服务实例，同时支持模型并行，如 0,1:2,3，以冒号切分，表示0卡和1卡跑一个模型服务实例，2卡和3卡跑一个模型服务实例。默认为0卡只跑一个模型服务实例。 QUANTIZATION：为量化选项，不传入默认为None

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > 主流开源大模型基于Lite Server&Cluster适配Ascend-vLLM PyTorch NPU推理指导（6.5.905）
设置在线服务故障自动重启 - AI开发平台ModelArts

设置在线服务故障自动重启场景描述当系统检测到Snt9b硬件故障时，自动复位Snt9B芯片并重启推理在线服务，提升了推理在线服务的恢复速度。约束限制仅支持使用Snt9b资源的同步在线服务。只支持针对整节点资源复位，请确保部署的在线服务为8*N卡规格，请谨慎评估对部署在该节点的其他服务的影响。

帮助中心 > AI开发平台ModelArts > ModelArts Standard用户指南 > 使用ModelArts Standard部署模型并推理预测 > 管理同步在线服务
创建模型成功后，部署服务报错，如何排查代码问题 - AI开发平台ModelArts

处理方法服务部署失败后，进入服务详情界面，查看服务部署日志，明确服务部署失败原因（用户代码输出需要使用标准输入输出函数，否则输出的内容不会呈现到前端页面日志）。根据日志中提示的报错信息找到对应的代码进行定位。如果模型启动失败根本没有日志，则考虑使用推理模型调试功能，具体参见：在开发环境中构建并调试推理镜像。

帮助中心 > AI开发平台ModelArts > 故障排除 > 推理部署 > 模型管理
推理服务精度评测 - 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.5.901） - AI开发平台ModelArts

推理服务精度评测本章节介绍了2种精度测评方式，分别为Lm-eval工具和MME工具。 lm-eval工具适用于语言模型的推理精度测试，数据集包含mmlu、ARC_Challenge、GSM_8k、Hellaswag、Winogrande、TruthfulQA等，该工具为离线测评，不需要启动推理服务。

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.5.901）
推理服务精度评测 - 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912） - AI开发平台ModelArts

推理服务精度评测本章节介绍了2种精度测评方式，分别为Lm-eval工具和MME工具。 lm-eval工具适用于语言模型的推理精度测试，数据集包含mmlu、ARC_Challenge、GSM_8k、Hellaswag、Winogrande、TruthfulQA等，该工具为离线测评，不需要启动推理服务。

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > LLM大语言模型推理历史版本文档 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912）
ModelArts在线服务和边缘服务有什么区别？ - AI开发平台ModelArts

ModelArts在线服务和边缘服务有什么区别？在线服务将模型部署为一个Web服务，您可以通过管理控制台或者API接口访问在线服务。边缘服务云端服务是集中化的离终端设备较远，对于实时性要求高的计算需求，把计算放在云上会引起网络延时变长、网络拥塞、服务质量下降等问题。而终端

 帮助中心 > AI开发平台ModelArts > 常见问题 > Standard推理部署
在Notebook调试环境中部署推理服务 - 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.909） - AI开发平台ModelArts

quit) Step4 请求推理服务另外启动一个terminal，使用命令测试推理服务是否正常启动，端口请修改为启动服务时指定的端口。使用命令测试推理服务是否正常启动。服务启动命令中的参数设置请参见表1。方式一：通过OpenAI服务API接口启动服务使用以下推理测试命令。${d

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > LLM大语言模型推理历史版本文档 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.909）
（可选）本地服务器安装ModelArts SDK - AI开发平台ModelArts

服务。 ModelArts SDK使用限制本地ModelArts SDK不支持进行训练作业调测、模型调试和在开发环境中部署本地服务进行调试，当前仅支持在开发环境Notebook中调试。本地安装ModelArts SDK步骤在本地安装ModelArts SDK，具体的配置步骤如下：

帮助中心 > AI开发平台ModelArts > SDK参考
在Notebook调试环境中部署推理服务 - 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.911） - AI开发平台ModelArts

quit) Step4 请求推理服务另外启动一个terminal，使用命令测试推理服务是否正常启动，端口请修改为启动服务时指定的端口。使用命令测试推理服务是否正常启动。服务启动命令中的参数设置请参见表1。方式一：通过OpenAI服务API接口启动服务使用以下推理测试命令。${d

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > LLM大语言模型推理历史版本文档 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.911）
推理服务性能评测 - AI开发平台ModelArts

推理服务性能评测语言模型推理性能测试多模态模型推理性能测试父主题：主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912）

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型推理 > LLM大语言模型推理历史版本文档 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912）

总条数： 1968

上一页
1
2
3
4
5
...
99
下一页
跳转

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消