- 算法理解障碍:帮助读者透彻理解深度学习算法及其硬件映射方式,避免算法与硬件脱节。
- 架构设计迷茫:系统讲解运算子系统和存储子系统的设计方法,解决从零设计加速器的难题。
- 工程落地困难:提供产品级加速器设计的完整流程,涵盖控制通路与数据通路的关键技术。
- 性能优化瓶颈:深入剖析加速器设计中常见问题及解决策略,提升芯片能效比。
- 经验知识断层:融合作者15年CPU/GPU/NPU经验,弥补端侧与云侧架构设计的知识空白。
★★★
中级
入门初级中级进阶高级
- 芯片架构师:需要设计NPU或AI加速器,本书提供从算法到架构的完整方法论。
- 硬件工程师:从事数字电路设计,希望深入理解神经网络硬件实现细节。
- AI软件开发者:需要了解硬件特性以优化模型部署,本书能打通软硬件壁垒。
- 高校研究生:研究AI芯片或计算机体系结构,本书是理论与实践结合的绝佳参考。
- 先读算法基础:前两章重点掌握神经网络结构,为后续硬件设计打下基础。
- 核心章节精读:运算子系统和存储子系统设计是重点,建议反复阅读并画图理解。
- 结合实践思考:每章后尝试用Verilog或SystemC实现小模块,加深理解。
- 对照真实芯片:阅读时对照主流NPU(如寒武纪、英伟达)架构,验证所学。
- 最后通读全篇:通读后回顾控制通路与数据通路,形成系统级认知。
- 算法硬件贯通:掌握深度学习算法到硬件架构的映射方法,实现软硬件协同设计。
- 架构设计能力:学会设计运算子系统和存储子系统,具备独立搭建NPU架构的能力。
- 工程问题解决:了解加速器设计中的典型问题及解决方案,提升工程实战水平。
- 前沿视野拓展:理解端侧与云侧NPU的异同,把握AI芯片发展趋势。
- 产品级思维:从需求分析到芯片实现,建立产品级加速器的全流程设计思维。
📖 书籍简介
这是一本讲解NPU硬件架构设计与技术实现的著作。作者将自己在CPU、GPU和NPU领域15年的软硬件工作经验融会贯通,将四代NPU架构设计经验融为一体,将端侧和云侧NPU架构合二为一,总结并提炼出本书内容。本书主要讨论神经网络硬件层面,尤其是芯片设计层面的内容,主要包含神经网络的分析、神经网络加速器的设计以及具体实现技术。通过阅读本书,读者可以深入了解主流的神经网络结构,掌握如何从零开始设计一个能用、好用的产品级加速器。
通过阅读本书,你将:
透彻理解与深度学习相关的机器学习算法及其实现
学会主流图像处理领域神经网络的结构
掌握加速器运算子系统和存储子系统的设计
摸清加速器设计中遇到的具体问题及其解决方法
了解NPU架构需要考虑的控制通路和数据通路
📑 章节目录
CONTENTS 目 录 前言 第1章 卷积神经网络 1 1.1 神经网络的结构 2 1.2 GCN 4 1.3 网络的基本块 7 1.4 网络的算子 17 1.5 网络参数量与运算量 29 1.6 加速器编程模型 31 1.7 硬件加速器架构分类 33 第2章 运算子系统的设计 35 2.1 数据流设计 35 2.2 算力与带宽 38