aclnnArgMin
aclnnArange
接口原型
每个算子有两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。两段式接口如下:
- 第一段接口:aclnnStatus aclnnArangeGetWorkspaceSize(const aclScalar *start, const aclScalar *end, const aclScalar *step, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
- 第二段接口:aclnnStatus aclnnArange(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
功能描述
-
算子功能:生成一个等差张量。从start起始到end结束,按照step间隔取值并保存到输出的1维张量中,数据取值范围为[start, end)。
-
计算公式:
aclnnArangeGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnArangeGetWorkspaceSize(const aclScalar *start, const aclScalar *end, const aclScalar *step, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- start:Host侧的aclScalar,获取值的范围的起始位置。数据类型支持FLOAT、FLOAT16、DOUBLE、UINT8、INT8、INT16、INT32、INT64、BOOL、BFLOAT16(仅Atlas A2训练系列产品支持),数据格式支持ND。需要满足在step大于0时输入的start小于end,或者step小于0时输入的start大于end。
- end:Host侧的aclScalar,获取值的范围的结束位置。数据类型支持FLOAT、FLOAT16、DOUBLE、UINT8、INT8、INT16、INT32、INT64、BOOL、BFLOAT16(仅Atlas A2训练系列产品支持),数据格式支持ND。需要满足在step大于0时输入的start小于end,或者step小于0时输入的start大于end。
- step:Host侧的aclScalar,获取值的步长。数据类型支持FLOAT、FLOAT16、DOUBLE、UINT8、INT8、INT16、INT32、INT64、BOOL、BFLOAT16(仅Atlas A2训练系列产品支持),数据格式支持ND。需要满足step不等于0。
- out:Device侧的aclTensor,输出的tensor。数据类型支持FLOAT、FLOAT16、DOUBLE、INT32、INT64、BFLOAT16(仅Atlas A2训练系列产品支持),数据格式支持ND。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的start、end、step或者out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- 参数start、end、step、out的数据类型不在支持的范围内。
- 参数start、end、step不满足range的运算逻辑,即当step>0时输入的start大于end,或者step<0时输入的start小于end,或者step等于0。 :::
aclnnArange
-
接口定义:
aclnnStatus aclnnArange(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnArangeGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br>123<br>124<br>125<br>126<br>127<br>128<br>129<br>130<br>131<br>132<br>133<br>134<br>135<br>136<br>137<br>138<br>139<br>140<br>141<br>142<br>143<br>144<br>145<br> | cpp<br>#include <iostream><br>#include <vector><br>#include <math.h><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_arange.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t> &shape) {<br> int64_t shape_size = 1;<br> for (auto i : shape) {<br> shape_size *= i;<br> }<br> return shape_size;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T> &hostData, const std::vector<int64_t> &shape, void **deviceAddr,<br> aclDataType dataType, aclTensor **tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(),<br> shape.size(),<br> dataType,<br> strides.data(),<br> 0,<br> aclFormat::ACL_FORMAT_ND,<br> shape.data(),<br> shape.size(),<br> *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化, 参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> // check根据自己的需要处理<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> void *outDeviceAddr = nullptr;<br> aclScalar *start = nullptr;<br> aclScalar *end = nullptr;<br> aclScalar *step = nullptr;<br> aclTensor *out = nullptr;<br> float startValue = 1.0f;<br> float endValue = 5.0f;<br> float stepValue = 1.0f;<br> double size_arange = ceil(static_cast<double>(endValue - startValue) / stepValue);<br> int64_t size_value = static_cast<int64_t>(size_arange);<br> std::vector<int64_t> outShape = {size_value};<br> std::vector<float> outHostData(size_value, 0);<br> // 创建start aclScalar<br> start = aclCreateScalar(&startValue, aclDataType::ACL_FLOAT);<br> CHECK_RET(start != nullptr, return ret);<br> // 创建end aclScalar<br> end = aclCreateScalar(&endValue, aclDataType::ACL_FLOAT);<br> CHECK_RET(end != nullptr, return ret);<br> // 创建step aclScalar<br> step = aclCreateScalar(&stepValue, aclDataType::ACL_FLOAT);<br> CHECK_RET(step != nullptr, return ret);<br> // 创建out aclTensor<br> ret = CreateAclTensor(outHostData, outShape, &outDeviceAddr, aclDataType::ACL_FLOAT, &out);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 3. 调用CANN算子库API<br> uint64_t workspaceSize = 0;<br> aclOpExecutor *executor;<br> // 调用aclnnArange第一段接口<br> ret = aclnnArangeGetWorkspaceSize(start, end, step, out, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArangeGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void *workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret;);<br> }<br> // 调用aclnnArange第二段接口<br> ret = aclnnArange(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArange failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size = GetShapeSize(outShape);<br> std::vector<float> resultData(size, 0);<br> ret = aclrtMemcpy(resultData.data(),<br> resultData.size() * sizeof(resultData[0]),<br> outDeviceAddr,<br> size * sizeof(resultData[0]),<br> ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size; i++) {<br> LOG_PRINT("result[%ld] is: %f\n", i, resultData[i]);<br> }<br> // 6. 释放aclTensor和aclScalar,需要根据具体API的接口定义修改<br> aclDestroyScalar(start);<br> aclDestroyScalar(end);<br> aclDestroyScalar(step);<br> aclDestroyTensor(out);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
aclnnArgMax
接口原型
每个算子有两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。两段式接口如下:
- 第一段接口:aclnnStatus aclnnArgMaxGetWorkspaceSize(const aclTensor *self, const int64_t dim, const bool keepdim, aclTensor *out, uint64_t *workspace_size, aclOpExecutor **executor)
- 第二段接口:aclnnStatus aclnnArgMax(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
功能描述
算子功能:返回张量在指定维度dim上的最大值索引,并保存在输出张量out中。
aclnnArgMaxGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnArgMaxGetWorkspaceSize(const aclTensor *self, const int64_t dim, const bool keepdim, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- self:Device侧的aclTensor,数据类型支持 FLOAT、FLOAT16、DOUBLE、INT8、INT16、INT32、INT64、UINT8。数据格式支持ND。支持非连续的Tensor。
- dim:Host侧INT64类型,指定了要进行最大值计算的维度,取值范围为[-self.dim(), self.dim()-1]。
- keepdim:Host侧的BOOL类型,是否在输出张量中保留输入张量的维度。
- out:Device侧的aclTensor,数据类型支持INT32、INT64。数据格式支持ND。支持非连续的Tensor。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的self或out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- self的数据类型和数据格式不在支持的范围内。
- self或out为私有格式。 :::
aclnnArgMax
-
接口定义:
aclnnStatus aclnnArgMax(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnArgMaxGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br>123<br>124<br>125<br> | cpp<br>#include <iostream><br>#include <vector><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_argmax.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t>& shape) {<br> int64_t shape_size = 1;<br> for (auto i : shape) {<br> shape_size *= i;<br> }<br> return shape_size;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T>& hostData, const std::vector<int64_t>& shape, void** deviceAddr,<br> aclDataType dataType, aclTensor** tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND,<br> shape.data(), shape.size(), *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化, 参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> // check根据自己的需要处理<br> CHECK_RET(ret == 0, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> std::vector<int64_t> selfShape = {4, 2};<br> std::vector<int64_t> outShape = {2};<br> void* selfDeviceAddr = nullptr;<br> void* outDeviceAddr = nullptr;<br> aclTensor* self = nullptr;<br> aclTensor* out = nullptr;<br> std::vector<float> selfHostData = {0, 1, 2, 3, 4, 5, 6, 7};<br> std::vector<int64_t> outHostData = {0, 0};<br> // 创建self aclTensor<br> ret = CreateAclTensor(selfHostData, selfShape, &selfDeviceAddr, aclDataType::ACL_FLOAT, &self);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 创建out aclTensor<br> ret = CreateAclTensor(outHostData, outShape, &outDeviceAddr, aclDataType::ACL_INT64, &out);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> int64_t dim = 0;<br> bool keepdim = false;<br> // 3.调用CANN算子库API,需要修改为具体的算子接口<br> uint64_t workspaceSize = 0;<br> aclOpExecutor* executor;<br> // 调用aclnnArgMax第一段接口<br> ret = aclnnArgMaxGetWorkspaceSize(self, dim, keepdim, out, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgMaxGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret;);<br> }<br> // 调用aclnnArgMax第二段接口<br> ret = aclnnArgMax(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgMax failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size = GetShapeSize(outShape);<br> std::vector<int64_t> resultData(size, 0);<br> ret = aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), outDeviceAddr, size * sizeof(int64_t),<br> ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size; i++) {<br> LOG_PRINT("result[%ld] is: %ld\n", i, resultData[i]);<br> }<br> // 6. 释放aclTensor,需要根据具体API的接口定义修改<br> aclDestroyTensor(self);<br> aclDestroyTensor(out);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
aclnnArgMin
接口原型
每个算子有两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。两段式接口如下:
- 第一段接口:aclnnStatus aclnnArgMinGetWorkspaceSize(const aclTensor *self, int64_t dim, bool keepdim, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
- 第二段接口:aclnnStatus aclnnArgMin(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
功能描述
算子功能:返回张量self中指定轴dim的最小值索引,并存到out中。
- 如果keepdim=False,不保留对应的轴。
- 如果为keepdim=True,输出张量的shape维度与输入相同,对应的轴维度值为1。
aclnnArgMinGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnArgMinGetWorkspaceSize(const aclTensor *self, int64_t dim, bool keepdim, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- self:Device侧aclTensor,输入张量,数据类型支持FLOAT16、FLOAT、FLOAT64、INT8、UINT8、INT16、INT32、INT64。支持非连续的Tensor,数据格式支持ND。
- dim:Host侧INT64类型,指定要进行最小值计算的维度,取值范围为[-self.dim(), self.dim())。
- keepdim:Host侧的BOOL类型,输出张量是否要保留输入张量的维度。 如果为False,则不保留对应的的轴;如果为True,则返回tensor的shape维度与self相同,对应的轴维度值为1。
- out:Device侧aclTensor,输出张量,数据类型支持INT32、INT64,数据格式支持ND,支持非连续的Tensor。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的self或out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- 参数self、out的数据类型和数据格式不在支持的范围内。
- dim值不合法。
- self为空tensor。
- 传入的out shape不满足推导的shape。 :::
aclnnArgMin
-
接口定义:
aclnnStatus aclnnArgMin(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, const aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnArgMinGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br>123<br>124<br>125<br>126<br>127<br>128<br> | cpp<br>#include <iostream><br>#include <vector><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_argmin.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t>& shape) {<br> int64_t shape_size = 1;<br> for (auto i : shape) {<br> shape_size *= i;<br> }<br> return shape_size;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T>& hostData, const std::vector<int64_t>& shape, void** deviceAddr,<br> aclDataType dataType, aclTensor** tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND,<br> shape.data(), shape.size(), *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化, 参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> // check根据自己的需要处理<br> CHECK_RET(ret == 0, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> std::vector<int64_t> selfShape = {4, 2};<br> std::vector<int64_t> outShape = {1, 2};<br> void* selfDeviceAddr = nullptr;<br> void* outDeviceAddr = nullptr;<br> aclTensor* self = nullptr;<br> aclTensor* out = nullptr;<br> std::vector<int32_t> selfHostData = {3, 3, 2, 3, 4, 2, 6, 7};<br> std::vector<int32_t> outHostData(2, 0);<br> int64_t realDim = 0;<br> bool realKeepDim = true;<br> // 创建self aclTensor<br> ret = CreateAclTensor(selfHostData, selfShape, &selfDeviceAddr, aclDataType::ACL_INT32, &self);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 创建out aclTensor<br> ret = CreateAclTensor(outHostData, outShape, &outDeviceAddr, aclDataType::ACL_INT32, &out);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 3.调用CANN算子库API,需要修改为具体的算子接口<br> uint64_t workspaceSize = 0;<br> aclOpExecutor* executor;<br> // 调用aclnnArgMin第一段接口<br> ret = aclnnArgMinGetWorkspaceSize(self, realDim, realKeepDim, out, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgMinGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret;);<br> }<br> // 调用aclnnArgMin第二段接口<br> ret = aclnnArgMin(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgMin failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size = GetShapeSize(outShape);<br> std::vector<int32_t> resultData(size, 0);<br> ret = aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), outDeviceAddr, size * sizeof(resultData[0]),<br> ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size; i++) {<br> LOG_PRINT("result[%ld] is: %d\n", i, resultData[i]);<br> }<br> // 6. 释放aclTensor和aclScalar,需要根据具体API的接口定义修改<br> aclDestroyTensor(self);<br> aclDestroyTensor(out);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
aclnnArgsort
接口原型
每个算子有两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。两段式接口如下:
- **第一段接口:**aclnnStatus aclnnArgsortGetWorkspaceSize(const aclTensor *self, int64_t dim, bool descending, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
- **第二段接口:**aclnnStatus aclnnArgsort(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
功能描述
算子功能:返回对张量进行排序的索引,支持按指定轴排序。
aclnnArgsortGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnArgsortGetWorkspaceSize(const aclTensor *self, int64_t dim, bool descending, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- self:Device侧的aclTensor,数据类型支持FLOAT、FLOAT16、INT32、INT64、INT16、INT8、UINT8,支持非连续的Tensor,数据格式支持ND,shape在dim维度上的值小于INT32的最大值。
- dim:Host侧的int64,指定排序的维度,取值范围为[-self.dim(), self.dim())。
- descending:Host侧的BOOL类型,指定升序或降序排序。当取值False时,为升序。
- out:Device侧的aclTensor,输出排序后的索引。数据类型支持INT64,shape与self保持一致。支持非连续的Tensor,数据格式支持ND。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的self或out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- self和out的数据类型不在支持的范围之内。
- dim的取值不在支持的范围内。
- shape在dim上对应的值大于INT32的最大值。 :::
aclnnArgsort
-
接口定义:
aclnnStatus aclnnArgsort(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnArgsortGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br>123<br>124<br>125<br> | cpp<br>#include <iostream><br>#include <vector><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_argsort.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t>& shape) {<br> int64_t shapeSize = 1;<br> for (auto i : shape) {<br> shapeSize *= i;<br> }<br> return shapeSize;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T>& hostData, const std::vector<int64_t>& shape, void** deviceAddr,<br> aclDataType dataType, aclTensor** tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND,<br> shape.data(), shape.size(), *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化,参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> int64_t dim = 0;<br> bool descending = false;<br> std::vector<int64_t> selfShape = {3, 4};<br> std::vector<int64_t> outIndicesShape = {3, 4};<br> void* selfDeviceAddr = nullptr;<br> void* outIndicesDeviceAddr = nullptr;<br> aclTensor* self = nullptr;<br> aclTensor* outIndices = nullptr;<br> std::vector<int64_t> selfHostData = {7, 8, 9, 10, 11, 12, 1, 2, 3, 4, 5, 6};<br> std::vector<int64_t> outIndicesHostData = {0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0};<br> // 创建self aclTensor<br> ret = CreateAclTensor(selfHostData, selfShape, &selfDeviceAddr, aclDataType::ACL_INT64, &self);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 创建outValues和outIndices aclTensor<br> ret = CreateAclTensor(outIndicesHostData, outIndicesShape, &outIndicesDeviceAddr, aclDataType::ACL_INT64, &outIndices);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 3. 调用CANN算子库API,需要修改为具体的API名称<br> uint64_t workspaceSize = 0;<br> aclOpExecutor* executor;<br> // 调用aclnnArgsort第一段接口<br> ret = aclnnArgsortGetWorkspaceSize(self, dim, descending, outIndices, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgsortGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret);<br> }<br> // 调用aclnnArgsort第二段接口<br> ret = aclnnArgsort(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnArgsort failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size2 = GetShapeSize(outIndicesShape);<br> std::vector<int64_t> resultData2(size2, 0);<br> ret = aclrtMemcpy(resultData2.data(), resultData2.size() * sizeof(resultData2[0]), outIndicesDeviceAddr,<br> size2 * sizeof(resultData2[0]), ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size2; i++) {<br> LOG_PRINT("result indices [%ld] is: %ld\n", i, resultData2[i]);<br> }<br> // 6. 释放aclTensor和aclScalar,需要根据具体API的接口定义修改<br> aclDestroyTensor(self);<br> aclDestroyTensor(outIndices);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
aclnnAsin
接口原型
每个算子有两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。两段式接口如下:
- **第一段接口:**aclnnStatus aclnnAsinGetWorkspaceSize(const aclTensor *self, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
- **第二段接口:**aclnnStatus aclnnAsin(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
功能描述
-
算子功能:对输入矩阵的每个元素进行反正弦操作后输出。
-
计算公式:
aclnnAsinGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnAsinGetWorkspaceSize(const aclTensor *self, aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- self(aclTensor*, 计算输入):Device侧的aclTensor,数据类型支持FLOAT、FLOAT16、DOUBLE、INT32、INT64、INT16、INT8、UINT8、BOOL、BFLOAT16(仅Atlas A2训练系列产品支持)。当类型为INT8、INT16、UINT8、BOOL、INT32、INT64 时,转为FLOAT32运算,输出FLOAT32类型。当类型为BFLOAT16时,转为FLOAT计算,再转为BFLOAT16输出。支持非连续的Tensor,支持空Tensor传入,数据格式支持ND。
- out(aclTensor*, 计算输出):Device侧的aclTensor,数据类型支持FLOAT、FLOAT16、DOUBLE、BFLOAT16(仅Atlas A2训练系列产品支持),且shape要与self一致。支持非连续的Tensor,支持空Tensor传入,数据格式支持ND。
- workspaceSize(uint64_t*, 出参):返回用户需要在Device侧申请的workspace大小。
- executor(aclOpExecutor**, 出参):返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的self或out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- self和out的数据类型不在支持的范围之内。
- out与self的shape不一致。
- self的维度超过8维。 :::
aclnnAsin
-
接口定义:
aclnnStatus aclnnAsin(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
-
参数说明:
- workspace(void*, 入参):在Device侧申请的workspace内存起址。
- workspaceSize(uint64_t, 入参):在Device侧申请的workspace大小,由第一段接口aclnnAsinGetWorkspaceSize获取。
- executor(aclOpExecutor*, 入参):op执行器,包含了算子计算流程。
- stream(aclrtStream, 入参):指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br> | cpp<br>#include <iostream><br>#include <vector><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_asin.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t>& shape) {<br> int64_t shapeSize = 1;<br> for (auto i : shape) {<br> shapeSize *= i;<br> }<br> return shapeSize;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T>& hostData, const std::vector<int64_t>& shape, void** deviceAddr,<br> aclDataType dataType, aclTensor** tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND,<br> shape.data(), shape.size(), *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化,参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> // check根据自己的需要处理<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> std::vector<int64_t> selfShape = {4, 2};<br> std::vector<int64_t> outShape = {4, 2};<br> void* selfDeviceAddr = nullptr;<br> void* outDeviceAddr = nullptr;<br> aclTensor* self = nullptr;<br> aclTensor* out = nullptr;<br> std::vector<float> selfHostData = {0.1, 0.2, 0.3, 0.4, 0.5, 0.6, 0.7,0.8};<br> std::vector<float> outHostData = {0, 0, 0, 0, 0, 0, 0, 0};<br> // 创建self aclTensor<br> ret = CreateAclTensor(selfHostData, selfShape, &selfDeviceAddr, aclDataType::ACL_FLOAT, &self);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 创建out aclTensor<br> ret = CreateAclTensor(outHostData, outShape, &outDeviceAddr, aclDataType::ACL_FLOAT, &out);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 3. 调用CANN算子库API,需要修改为具体的API名称<br> uint64_t workspaceSize = 0;<br> aclOpExecutor* executor;<br> // 调用aclnnAsin第一段接口<br> ret = aclnnAsinGetWorkspaceSize(self, out, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnAsinGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret);<br> }<br> // 调用aclnnAsin第二段接口<br> ret = aclnnAsin(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnAsin failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size = GetShapeSize(outShape);<br> std::vector<float> resultData(size, 0);<br> ret = aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), outDeviceAddr, <br> size * sizeof(resultData[0]), ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size; i++) {<br> LOG_PRINT("result[%ld] is: %f\n", i, resultData[i]);<br> }<br> // 6. 释放aclTensor,需要根据具体API的接口定义修改<br> aclDestroyTensor(self);<br> aclDestroyTensor(out);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
aclnnAsinh/aclnnInplaceAsinh
接口原型
:::note 说明
-
aclnnAsinhv和aclnnInplaceAsinh实现相同的功能,其使用区别如下,请根据自身实际场景选择合适的算子。
- aclnnAsinh:需新建一个输出张量对象存储计算结果。
- aclnnInplaceAsinh:无需新建输出张量对象,直接在输入张量的内存中存储计算结果。
-
每个算子分为两段接口,必须先调用“aclnnXxxGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小,再调用“aclnnXxx”接口执行计算。 :::
-
aclnnAsinh两段式接口如下:
- **第一段接口:**aclnnStatus aclnnAsinhGetWorkspaceSize(const aclTensor *self, const aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
- **第二段接口:**aclnnStatus aclnnAsinh(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
-
aclnnInplaceAsinh两段式接口如下:
- **第一段接口:**aclnnStatus aclnnInplaceAsinhGetWorkspaceSize(aclTensor *selfRef, uint64_t *workspaceSize, aclOpExecutor **executor)
- **第二段接口:**aclnnStatus aclnnInplaceAsinh(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
功能描述
-
算子功能:对输入Tensor中的每个元素进行反双曲正弦计算并输出。
-
计算公式:
aclnnAsinhGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnAsinhGetWorkspaceSize(const aclTensor *self, const aclTensor *out, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- self:输入张量,Device侧的aclTensor,数据类型支持FLOAT16、FLOAT、DOUBLE、INT32、INT64、INT16、INT8、UINT8、BOOL、COMPLEX64、COMPLEX128。当类型为INT8、INT16、UINT8、BOOL、INT32、INT64时,转化为FLOAT32进行运算,输出FLOAT32类型。支持非连续的Tensor,数据格式支持ND,维度不大于8,且shape需要与out一致。
- out:输出张量,Device侧的aclTensor,数据类型支持FLOAT16、FLOAT、DOUBLE、COMPLEX64、COMPLEX128,支持非连续Tensor,数据格式支持ND。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的self或out是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- self和out的数据类型不在支持的范围内。
- self和out的shape不一致。
- self或out的维数大于8。 :::
aclnnAsinh
-
接口定义:
aclnnStatus aclnnAsinh(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnAsinhGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
aclnnInplaceAsinhGetWorkspaceSize
-
接口定义:
aclnnStatus aclnnInplaceAsinhGetWorkspaceSize(aclTensor *selfRef, uint64_t *workspaceSize, aclOpExecutor **executor)
-
参数说明:
- selfRef:输入/输出张量,Device侧的aclTensor,数据类型支持FLOAT16、FLOAT、DOUBLE、COMPLEX64、COMPLEX128,支持非连续的Tensor,数据格式支持ND,维度不大于8。
- workspaceSize:返回用户需要在Device侧申请的workspace大小。
- executor:返回op执行器,包含了算子计算流程。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
:::note 说明 第一段接口完成入参校验,出现以下场景时报错:
- 返回161001(ACLNN_ERR_PARAM_NULLPTR):传入的selfRef是空指针。
- 返回161002(ACLNN_ERR_PARAM_INVALID):
- selfRef的数据类型不在支持的范围之内。
- selfRef的维数大于8。 :::
aclnnInplaceAsinh
-
接口定义:
aclnnStatus aclnnInplaceAsinh(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)
-
参数说明:
- workspace:在Device侧申请的workspace内存起址。
- workspaceSize:在Device侧申请的workspace大小,由第一段接口aclnnInplaceAsinhGetWorkspaceSize获取。
- executor:op执行器,包含了算子计算流程。
- stream:指定执行任务的AscendCL stream流。
-
返回值:
返回aclnnStatus状态码,具体参见aclnn返回码。
调用示例
<br> 1<br> 2<br> 3<br> 4<br> 5<br> 6<br> 7<br> 8<br> 9<br> 10<br> 11<br> 12<br> 13<br> 14<br> 15<br> 16<br> 17<br> 18<br> 19<br> 20<br> 21<br> 22<br> 23<br> 24<br> 25<br> 26<br> 27<br> 28<br> 29<br> 30<br> 31<br> 32<br> 33<br> 34<br> 35<br> 36<br> 37<br> 38<br> 39<br> 40<br> 41<br> 42<br> 43<br> 44<br> 45<br> 46<br> 47<br> 48<br> 49<br> 50<br> 51<br> 52<br> 53<br> 54<br> 55<br> 56<br> 57<br> 58<br> 59<br> 60<br> 61<br> 62<br> 63<br> 64<br> 65<br> 66<br> 67<br> 68<br> 69<br> 70<br> 71<br> 72<br> 73<br> 74<br> 75<br> 76<br> 77<br> 78<br> 79<br> 80<br> 81<br> 82<br> 83<br> 84<br> 85<br> 86<br> 87<br> 88<br> 89<br> 90<br> 91<br> 92<br> 93<br> 94<br> 95<br> 96<br> 97<br> 98<br> 99<br>100<br>101<br>102<br>103<br>104<br>105<br>106<br>107<br>108<br>109<br>110<br>111<br>112<br>113<br>114<br>115<br>116<br>117<br>118<br>119<br>120<br>121<br>122<br>123<br>124<br>125<br>126<br>127<br>128<br>129<br>130<br>131<br>132<br>133<br>134<br>135<br>136<br>137<br>138<br>139<br>140<br> | cpp<br>#include <iostream><br>#include <vector><br>#include "acl/acl.h"<br>#include "aclnnop/aclnn_asinh.h"<br>#define CHECK_RET(cond, return_expr) \<br> do { \<br> if (!(cond)) { \<br> return_expr; \<br> } \<br> } while (0)<br>#define LOG_PRINT(message, ...) \<br> do { \<br> printf(message, ##__VA_ARGS__); \<br> } while (0)<br>int64_t GetShapeSize(const std::vector<int64_t>& shape) {<br> int64_t shapeSize = 1;<br> for (auto i : shape) {<br> shapeSize *= i;<br> }<br> return shapeSize;<br>}<br>int Init(int32_t deviceId, aclrtContext* context, aclrtStream* stream) {<br> // 固定写法,AscendCL初始化<br> auto ret = aclInit(nullptr);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclInit failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetDevice(deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetDevice failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateContext(context, deviceId);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtSetCurrentContext(*context);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSetCurrentContext failed. ERROR: %d\n", ret); return ret);<br> ret = aclrtCreateStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtCreateStream failed. ERROR: %d\n", ret); return ret);<br> return 0;<br>}<br>template <typename T><br>int CreateAclTensor(const std::vector<T>& hostData, const std::vector<int64_t>& shape, void** deviceAddr,<br> aclDataType dataType, aclTensor** tensor) {<br> auto size = GetShapeSize(shape) * sizeof(T);<br> // 调用aclrtMalloc申请device侧内存<br> auto ret = aclrtMalloc(deviceAddr, size, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMalloc failed. ERROR: %d\n", ret); return ret);<br> // 调用aclrtMemcpy将Host侧数据拷贝到device侧内存上<br> ret = aclrtMemcpy(*deviceAddr, size, hostData.data(), size, ACL_MEMCPY_HOST_TO_DEVICE);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtMemcpy failed. ERROR: %d\n", ret); return ret);<br> // 计算连续tensor的strides<br> std::vector<int64_t> strides(shape.size(), 1);<br> for (int64_t i = shape.size() - 2; i >= 0; i--) {<br> strides[i] = shape[i + 1] * strides[i + 1];<br> }<br> // 调用aclCreateTensor接口创建aclTensor<br> *tensor = aclCreateTensor(shape.data(), shape.size(), dataType, strides.data(), 0, aclFormat::ACL_FORMAT_ND,<br> shape.data(), shape.size(), *deviceAddr);<br> return 0;<br>}<br>int main() {<br> // 1. (固定写法)device/context/stream初始化,参考AscendCL对外接口列表<br> // 根据自己的实际device填写deviceId<br> int32_t deviceId = 0;<br> aclrtContext context;<br> aclrtStream stream;<br> auto ret = Init(deviceId, &context, &stream);<br> // check根据自己的需要处理<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("Init acl failed. ERROR: %d\n", ret); return ret);<br> // 2. 构造输入与输出,需要根据API的接口自定义构造<br> std::vector<int64_t> selfShape = {4, 2};<br> std::vector<int64_t> outShape = {4, 2};<br> void* selfDeviceAddr = nullptr;<br> void* outDeviceAddr = nullptr;<br> aclTensor* self = nullptr;<br> aclTensor* out = nullptr;<br> std::vector<float> selfHostData = {0.1, 0.2, 0.3, 0.4, 0.5, 0.6, 0.7,0.8};<br> std::vector<float> outHostData = {0, 0, 0, 0, 0, 0, 0, 0};<br> // 创建self aclTensor<br> ret = CreateAclTensor(selfHostData, selfShape, &selfDeviceAddr, aclDataType::ACL_FLOAT, &self);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 创建out aclTensor<br> ret = CreateAclTensor(outHostData, outShape, &outDeviceAddr, aclDataType::ACL_FLOAT, &out);<br> CHECK_RET(ret == ACL_SUCCESS, return ret);<br> // 3. 调用CANN算子库API,需要修改为具体的API名称<br> uint64_t workspaceSize = 0;<br> aclOpExecutor* executor;<br> // 调用aclnnAsinh第一段接口<br> ret = aclnnAsinhGetWorkspaceSize(self, out, &workspaceSize, &executor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnAsinhGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* workspaceAddr = nullptr;<br> if (workspaceSize > 0) {<br> ret = aclrtMalloc(&workspaceAddr, workspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret);<br> }<br> // 调用aclnnAsinh第二段接口<br> ret = aclnnAsinh(workspaceAddr, workspaceSize, executor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnAsinh failed. ERROR: %d\n", ret); return ret);<br> uint64_t inplaceWorkspaceSize = 0;<br> aclOpExecutor* inplaceExecutor;<br> // 调用aclnnInplaceAsinh第一段接口<br> ret = aclnnInplaceAsinhGetWorkspaceSize(self, &inplaceWorkspaceSize, &inplaceExecutor);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnInplaceAsinhGetWorkspaceSize failed. ERROR: %d\n", ret); return ret);<br> // 根据第一段接口计算出的workspaceSize申请device内存<br> void* inplaceWorkspaceAddr = nullptr;<br> if (inplaceWorkspaceSize > 0) {<br> ret = aclrtMalloc(&inplaceWorkspaceAddr, inplaceWorkspaceSize, ACL_MEM_MALLOC_HUGE_FIRST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("allocate workspace failed. ERROR: %d\n", ret); return ret);<br> }<br> // 调用aclnnInplaceAsinh第二段接口<br> ret = aclnnInplaceAsinh(inplaceWorkspaceAddr, inplaceWorkspaceSize, inplaceExecutor, stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclnnInplaceAsinh failed. ERROR: %d\n", ret); return ret);<br> // 4. (固定写法)同步等待任务执行结束<br> ret = aclrtSynchronizeStream(stream);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("aclrtSynchronizeStream failed. ERROR: %d\n", ret); return ret);<br> // 5. 获取输出的值,将device侧内存上的结果拷贝至Host侧,需要根据具体API的接口定义修改<br> auto size = GetShapeSize(outShape);<br> std::vector<float> resultData(size, 0);<br> ret = aclrtMemcpy(resultData.data(), resultData.size() * sizeof(resultData[0]), outDeviceAddr, <br> size * sizeof(resultData[0]), ACL_MEMCPY_DEVICE_TO_HOST);<br> CHECK_RET(ret == ACL_SUCCESS, LOG_PRINT("copy result from device to host failed. ERROR: %d\n", ret); return ret);<br> for (int64_t i = 0; i < size; i++) {<br> LOG_PRINT("result[%ld] is: %f\n", i, resultData[i]);<br> }<br> // 6. 释放aclTensor,需要根据具体API的接口定义修改<br> aclDestroyTensor(self);<br> aclDestroyTensor(out);<br> return 0;<br>}<br> |
|---|
父主题: NN类算子接口
在线提单