跳转到主要内容
SDK Version: 2.4.0

DX-AllSuite 架构概述

本指南提供了**DXNN(DEEPX神经网络)**SDK架构、核心模块及支持环境的全面概述。

为什么选择DX-AllSuite

DX-AllSuite将从模型优化到目标硬件部署的复杂流程整合为单一工作流程

  • 无代码部署:将在桌面端验证的逻辑直接部署到边缘设备,无需修改代码。
  • 资源优化:减少环境配置和系统集成所花费的时间,专注于高性能AI应用程序开发。
  • 端到端解决方案:在单一软件包内提供模型编译、仿真、运行时执行和监控功能。

系统架构与核心模块

DXNN SDK full architecture overview diagram

图. DXNN SDK完整架构概述。

[1] AI模型编译环境(主机平台) 此环境将训练好的AI模型转换并优化为DEEPX NPU专用二进制文件(.dxnn)。支持x86_64 PC环境。

  • DX-COM(编译器):基于ONNX模型和用户配置(JSON)文件生成.dxnn二进制文件的核心编译器。通过专有算法将模型转换为硬件优化指令,在将精度损失降至最低的同时实现低延迟、高效率推理。
  • DX-TRON(可视化工具):可视化和分析.dxnn模型结构的GUI工具。通过颜色编码的图形直观展示NPU与CPU之间的工作负载分配,帮助开发者理解执行流程并优化性能。
  • DX-ModelZoo:针对DEEPX NPU优化的预训练模型仓库。同时提供ONNX模型、JSON配置和预编译的.dxnn二进制文件,使开发者无需编译过程即可立即测试和部署模型。

[2] AI模型运行时环境(目标平台) 此环境在实际NPU硬件上运行优化后的.dxnn模型,并将其集成到应用程序中。同时支持x86_64aarch64环境。

  • DX-RT(运行时):与固件和驱动程序交互,在DEEPX NPU上运行.dxnn模型的核心软件。管理模型加载、I/O缓冲区、推理执行和实时监控,并通过C/C++和Python API提供灵活控制。
  • DX-APP:基于DX-RT的示例应用程序。为主要视觉任务(目标检测、人脸识别、图像分类等)提供参考代码,帮助开发者利用这些模板快速构建独特的AI应用。
  • DX-Stream:将实时视频数据连接到DEEPX NPU推理的基于GStreamer的自定义插件。提供涵盖预处理、推理和后处理的模块化管道,针对智能摄像头等高性能视觉AI应用进行了优化。
  • 驱动程序与固件:支持通过PCIe接口进行高速数据通信以及NPU资源调度和电源管理。在确保硬件与软件之间稳定性的同时,最大化硬件潜能以提供流畅的推理环境。

开发工作流程 从训练好的模型到NPU加速的过程遵循四个逻辑步骤。

  • Step 1. 模型准备:将PyTorch或TensorFlow中训练好的模型导出为ONNX格式。
  • Step 2. 优化(主机):使用DX-COM对模型进行量化和硬件优化编译,生成.dxnn文件。
  • Step 3. 部署(目标):将生成的.dxnn文件传输到目标设备。
  • Step 4. 执行(目标):通过DX-RT在DEEPX NPU上运行高速推理。

技术兼容性(支持矩阵)

DX-AllSuite提供与最新操作系统及多种硬件架构的经验证兼容性,确保开发环境与边缘部署之间的稳定桥接。

DX-Compiler supported OS and hardware matrixDX-Runtime supported OS and hardware matrix

图. DX-Compiler和DX-Runtime支持生态系统。

硬件与OS(平台)

下表列出了编译(主机)和执行(目标)两个阶段所支持的环境。

类别DX-Compiler(主机)DX-Runtime(目标)
架构x86_64x86_64, aarch64
OSUbuntu 26.04/24.04/22.04/20.04,
Fedora, Redhat, CentOS
Ubuntu 26.04/24.04/22.04/20.04,
Debian 13/12, Windows 11/10
语言Python 3.8, 3.9, 3.10, 3.11, 3.12, 3.13, 3.14Python 3.8及以上,
C++14及以上(MSVC/Windows为C++17)

模型与软件生态系统

支持的AI框架 DX-AllSuite与行业标准框架无缝集成,最大限度减少重构工作。

  • 框架:Ultralytics(YOLO)、TensorFlow、PyTorch、Keras
  • 格式:ONNX(标准交换格式)

全球AI生态合作伙伴 与多个行业领先平台保持强大的技术合作关系,确保DXNN SDK在其中无缝运行。

  • 云端与平台:AWS(IoT Greengrass)、Baidu、DeGirum
  • 视觉与算法:Ultralytics(YOLO系列)、CVEDIA
  • VMS与安防:Network Optix(Nx)、VCA(Applied Intelligence)
  • 嵌入式OS:Wind River(VxWorks)

DEEPX ModelZoo与支持任务

DEEPX ModelZoo是提供345个预验证模型的综合仓库。无需手动编译过程,即可在各种硬件配置文件上即时验证性能和精度。

任务代表模型
图像分类ResNet, ResNeXt, MobileNet, EfficientNet (Lite/V2),
ViT/DeiT/BEiT, MobileViT, FastViT, CasViT,
RegNet, ShuffleNet, VGG
目标检测YOLO系列(YOLOv3–YOLOv11, YOLOX, YOLO26),
SSD, EfficientDet, NanoDet, DamoYOLO
3D目标检测3D检测模型
实例分割YOLACT, YOLOv5-Seg, YOLOv8-Seg, YOLO26-Seg
语义分割DeepLabV3/DeepLabV3+, SegFormer, BiSeNet, UNet
全景驾驶感知全景感知模型
旋转目标检测(OBB)YOLO26-OBB
零样本实例分割FastSAM
人脸检测RetinaFace, SCRFD, ULFGED, YOLOv5-Face, YOLOv7-Face
人脸识别ArcFace(IResNet50/100, MobileFaceNet, R50)
人脸关键点TDDFA v2(MobileNet变体)
人脸属性FaceAttrResNetV1-18
手部检测手部检测模型
手部关键点MediaPipeHandsLite
姿态估计(人体)CenterPose, YOLO26-Pose, YOLOv8-Pose
物体姿态估计物体姿态估计模型
关键点检测关键点检测模型
人员属性DeepMAR(ResNet18/50)
行人重识别CasViT
深度估计FastDepth, SCDepthV3
图像去噪DnCNN变体
低光增强ZeroDCE
超分辨率ESPCN(x2/x3/x4)

ModelZoo流水线核心功能

  • YAML驱动编排:通过单一YAML文件管理预处理、后处理、评估和编译配置,实现高可重现性和便捷运营。
  • 统一工作流程:将list、info、eval、compile、benchmark功能整合为单一CLI系统,可灵活组合各步骤。
  • 优化的多配置文件支持:所有模型均针对DEEPX NPU架构进行量化和优化,确保从ONNX评估到NPU执行的一致验证。
  • 可扩展注册表:支持对前/后处理、数据集和评估器的插件式扩展,实现自定义模型的快速接入。
  • 广泛的任务支持:超越基础分类和检测,广泛支持人脸分析、OBB、图像增强等服务级多样化CV任务。