BLOG

Record, summarize, and improve.

AI compiler Runtime

本文说明 AI 编译器 runtime 在模型部署中的职责,包括算子调度、内存管理、跨硬件抽象、优化算子调用、输入输出处理、调试 profiling 和异步推理支持。

LLaMA框架

本文通过 Transformer 与 LLaMA 的框架对比,介绍 LLaMA 类大模型的整体结构、关键模块及其与通用 Transformer 架构的关系。

Transformer:从注意力机制到高性能算子实现

本文从神经网络前向传播、损失计算、反向传播和权重更新出发,逐步介绍 Transformer 注意力机制及其面向高性能算子实现的计算过程。

大模型训练

大模型百科

AI系统

本文从数据、训练、推理和运行时四个层次介绍 AI 系统,讨论计算利用率、存储带宽、网络通信、低延迟与高吞吐等 AIInfra 工程问题,以及模型并行和异构调度思路。

计算图与中间表示(IR)

本文面向 MLIR 和深度学习编译器学习者,介绍计算图、数据依赖与渐进式 lowering,并梳理模型如何从高层张量算子逐步转换为循环、内存、向量和目标指令。

分布式深度学习

本文汇总分布式深度学习相关综述资料,聚焦大模型训练中的分布式计算、并行化和系统协同问题。

神经网络

深度学习

本文整理深度学习基础和 AI 硬件技术栈,涵盖神经网络模型、训练推理、算子、编译器、运行时及加速器之间的关系。