CANN/GE ACL算子编译执行V2接口
2026/9/10 8:42:19 网站建设 项目流程

aclopCompileAndExecuteV2

【免费下载链接】geGE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力,并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge

产品支持情况

  • Ascend 950PR/Ascend 950DT:不支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
  • Atlas 200I/500 A2 推理产品:支持
  • Atlas 推理系列产品:支持
  • Atlas 训练系列产品:支持
  • IPV350:不支持

功能说明

编译并执行指定的算子,当前只支持固定Shape的算子。每个算子的输入、输出、属性不同,接口会根据optype、输入tensor的描述、输出tensor的描述、attr等信息查找对应的任务,并下发执行,因此在调用本接口时需严格按照算子输入、输出、属性来组织算子。

在编译执行算子前,可以调用aclSetCompileopt接口设置编译选项。

函数原型

aclError aclopCompileAndExecuteV2(const char *opType, int numInputs, aclTensorDesc *inputDesc[], aclDataBuffer *inputs[], int numOutputs, aclTensorDesc *outputDesc[], aclDataBuffer *outputs[], aclopAttr *attr, aclopEngineType engineType, aclopCompileType compileFlag, const char *opPath, aclrtStream stream)

参数说明

参数名输入/输出说明
opType输入算子类型名称的指针。
numInputs输入算子输入tensor的数量。
inputDesc输入算子输入tensor描述的指针数组。类型定义请参见aclTensorDesc。
需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。
inputDesc数组中的元素个数必须与numInputs参数值保持一致,且inputs数组与inputDesc数组中的元素必须一一对应。
inputs输入算子输入tensor的指针数组。类型定义请参见aclDataBuffer。
需提前调用aclCreateDataBuffer接口创建aclDataBuffer类型的数据。
inputs数组中的元素个数必须与numInputs参数值保持一致,且inputs数组与inputDesc数组中的元素必须一一对应。
numOutputs输入算子输出tensor的数量。
outputDesc输入&输出算子输出tensor描述的指针数组。类型定义请参见aclTensorDesc。
需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。
outputDesc数组中的元素个数必须与numOutputs参数值保持一致,且outputs数组与outputDesc数组中的元素必须一一对应。
outputs输入&输出算子输出tensor的指针数组。类型定义请参见aclDataBuffer。
需提前调用aclCreateDataBuffer接口创建aclDataBuffer类型的数据。
outputs数组中的元素个数必须与numOutputs参数值保持一致,且outputs数组与outputDesc数组中的元素必须一一对应。
attr输入算子属性的指针。类型定义请参见aclopAttr。
需提前调用aclopCreateAttr接口创建aclopAttr类型。
engineType输入算子执行引擎。类型定义请参见aclopEngineType。
compileFlag输入算子编译标识。类型定义请参见aclopCompileType。
opPath输入算子实现文件(*.py)路径的指针,不包含文件名。预留参数,当前仅支持设置为nullptr。
stream输入该算子需要加载的stream。类型定义请参见aclrtStream。

返回值说明

返回0表示成功,返回其他值表示失败,请参见aclError。

约束说明

  • 多线程场景下,不支持调用本接口时指定同一个Stream或使用默认Stream,否则可能任务执行异常。

  • 编译、执行有可选输入的算子时,如果可选输入不使用,则:

    • 需调用aclCreateTensorDesc(ACL_DT_UNDEFINED, 0, nullptr, ACL_FORMAT_UNDEFINED)接口创建aclTensorDesc类型的数据,将数据类型设置为ACL_DT_UNDEFINED,将Format设置为ACL_FORMAT_UNDEFINED,将Shape信息设置为nullptr。
    • 需调用aclCreateDataBuffer(nullptr, 0)接口创建aclDataBuffer类型的数据,同时aclDataBuffer中的数据不需要释放,因为是空指针。
  • 编译、执行有constant输入的算子时,需要先调用aclSetTensorConst接口设置constant输入。

    对于算子有constant输入的场景,如果未调用aclSetTensorConst接口设置constant输入,则需调用aclSetTensorPlaceMent设置TensorDesc的placement属性,将memType设置为Host内存。

  • 在执行单算子时,一般要求用户传入的输入/输出tensor数据是存放在Device内存的,比如两个tensor相加的场景。但是,也存在部分算子,除了将featureMap、weight等Device内存中的tensor数据作为输入外,还需tensor shape信息、learningRate、tensor的dims信息等通常在Host内存中的tensor数据也作为输入,此时,用户不需要额外将这些Host内存中的tensor数据拷贝到Device上作为输入,只需要调用aclSetTensorPlaceMent接口设置对应TensorDesc的placement属性为Host内存,在执行单算子时,设置了placement属性为Host内存的TensorDesc,其对应的tensor数据必须存放在Host内存中,接口内部会自动将Host上的tensor数据拷贝到Device上。
  • 对于动态Shape的算子,无法明确算子输出Shape时,可调用aclopInferShape接口获取算子的输出Shape:
    • 若可获取到准确的输出Shape,则使用准确的输出Shape来构造outputDesc参数,作为aclopCompileAndExecuteV2的输入。该场景下,aclopCompileAndExecuteV2接口是异步接口,对于异步接口,调用接口成功仅表示任务下发成功,不表示任务执行成功。调用该接口后,需调用同步等待接口(例如,aclrtSynchronizeStream)确保任务已执行完成。
    • 若无法获取准确的输出Shape,仅能获取输出Shape范围,则使用Shape最大值来构造outputDesc参数,作为aclopCompileAndExecuteV2的输入。该场景下,在调用aclopCompileAndExecuteV2接口执行算子后,系统内部会计算出准确的输出Shape,通过aclopCompileAndExecuteV2接口的outputDesc参数输出,此时aclopCompileAndExecuteV2接口是同步接口
    • (该场景预留)若无法获取准确的输出Shape以及Shape范围,则需由用户预估一个最大的Shape来构造outputDesc参数,作为aclopCompileAndExecuteV2的输入。该场景下,在调用aclopCompileAndExecuteV2接口执行算子后,系统内部会计算出准确的输出Shape,通过aclopCompileAndExecuteV2接口的outputDesc参数输出,此时aclopCompileAndExecuteV2接口是同步接口

【免费下载链接】geGE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力,并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询