github PaddlePaddle/Paddle v3.4.0
PaddlePaddle 3.4.0 Release Notes

21 days ago

重要更新

飞桨框架 3.4 版本围绕大模型训练的训练效率、算子正确性、稳定性以及国产硬件适配等关键领域持续迭代。本版本新增面向大规模分布式训练的高性能 Muon 优化器;持续打磨核心算子的数值精度,并针对大模型训练中高频出现的大 Shape Tensor、0-Size Tensor 场景做了系统性的正确性排查与修复,进一步夯实大模型训练的稳定性与正确性。同时,生态兼容能力与昆仑芯 XPU 适配持续深化,开发体验和推理部署能力同步提升。需要说明的是,本版本是最后一个提供 Windows 系统支持的版本。

训练效率提升

  • Muon 优化器:新增 Muon 优化器,基于 batched GEMM、对称 GEMM 等技术对 Newton-Schulz 正交化过程做了高性能优化,并具备大规模并行训练能力。
  • 基于 VMM 的 Allocator v2:新增基于 CUDA 虚拟内存(VMM)的 best-fit 分配器 v2,支持大/小内存池分离查询与全 block 信息查询,改善 MoE 等动态显存场景下的碎片管理,显著减少显存碎片,并提供高性能的碎片整理能力。
  • FP8 量化能力增强:fp8_quant_blockwise 等 FP8 量化算子新增 ue8m0 scale 数据类型支持,并将适用范围扩展到非 128 对齐 block、大 Tensor 等场景。

正确性增强

  • 核心算子精度提升:系统性提升 matmul、linear、reduce 系列、elementwise 系列、activation 系列算子,以及 AdamW、layer_norm、rms_norm、group_norm、conv 等核心算子的计算精度。
  • 大 Shape Tensor 与 0-Size 正确性增强:系统性修复大 Shape Tensor 上的 int32 索引溢出,以及 0-Size Tensor 引发的 CUDA error(9)、段错误等正确性问题,全面保障大 Shape Tensor 与 0-Size 场景下的训练稳定性。

开发体验优化

  • 动转静(SOT)持续增强:SOT 全面支持 Python 3.11–3.14,新增多种字节码指令的处理能力,并实现与 PyTorch 对齐的反向 DFS 遍历调度。

国产硬件深度适配

  • 昆仑芯 XPU:新增 batched_gemm 与 CUDA Graph 支持,深度适配 DeepEP buffer 及 bkcl 通信库(支持 w4a8/w8a8 量化),并新增 complex128 数据类型支持。
  • 海光 DCU:将 CUDA native API 适配为 HIP native API,并在 ROCm 上为 conv 系列算子注册 bfloat16 kernel,进一步完善国产芯片适配并提升推理性能。

1. 训练效率提升

分布式策略优化(61 项)

基础功能增强(30 项)

  • 序列化与加载:paddle.save 支持 protocol=5 以实现零拷贝,并修复 dataclass 加载报错(2 项):#79675, #78452
  • 调试工具:新增 GPU tensor 调试与 CUDA error 检查能力,并增强 api_tracer(6 项):#78842, #78543, #78481, #78331, #78116, #77669
  • 动转静(SOT/Dy2St):新增字节码指令与 SizeVariable 支持,增强图编译能力与缓存命中校验(7 项):#77839, #77571, #77420, #77354, #77173, #77020, #76766
  • CustomDevice:支持自定义设备的混合编译(1 项):#77727
  • CINN:支持在 CustomDevice 上运行(1 项):#77158
  • DataType:优化哈希计算性能,并修复枚举顺序问题(1 项):#78076
  • PyLayer / recompute:优化 forward 输入处理,并修复 save_for_backward 与浅拷贝相关问题(2 项):#77899, #78053
  • 其它功能增强(10 项):#78521, #78055, #77879, #77829, #77675, #77651, #77533, #77089, #76773, #77898

显存分配器(9 项)

Bug 修复(30 项)

2. 算子优化完善

精度优化(46 项)

性能优化(22 项)

  • permute/transpose:重新设计实现算法,针对解码场景优化性能(4 项):#79742, #78063, #77524, #77371
  • 优化 cuBLAS workspace 的管理与复用性能(4 项):#79442, #79406, #79374, #77874
  • 归一化 kernel 性能优化:涵盖 rms_norm、layer_norm、squared_l2_norm 等(4 项):#79047, #77709, #77337, #77098
  • 优化器 kernel 性能优化:优化 Adam/AdamW GPU kernel,并将学习率的计算类型提升为 float64(2 项):#79044, #78949
  • TopK:基于 radix-select 与多层排序重写 GPU kernel,并修复相关问题(2 项):#78703, #79704
  • 其它算子 kernel 性能优化(6 项):#78601, #77818, #77233, #77071, #76988,#79150

大 Shape Tensor 与 0-Size 正确性(55 项)

Bug 修复(38 项)

算子其它优化(24 项)

3. 用户体验升级

本版本重点推进开发体验优化。C++ 侧新增 libtorch 兼容层(提供 torch/torch.h 头文件,并补齐 ScalarType、TypeMeta、SymInt、TensorAccessor、DLPack v1.3 等能力);Python 侧系统性对齐参数别名、Tensor 方法与 inplace 语义,并引入 inplace API 下沉机制。同时新增 index_fill、paddle.audio.functional.resample、assert_close 等实用 API,并修复 pickle 反序列化等安全漏洞。
Python API 优化(100 项)

新增 API(2 项)

  • 新增 index_fill/index_fill_、paddle.audio.functional.resample、paddle.testing.assert_close、Tensor.reset、Tensor.layout 等 API(2 项):#78041, #78032

C++ API 兼容 Torch(自定义算子)(64 项)

安全修复(3 项)

  • 安全加固:修复 pickle 反序列化远程代码执行漏洞(CWE-502)与 Zip Slip 路径穿越问题,并改用 yaml.safe_load 加载配置(3 项):#78508, #78085, #77113

4. 国产硬件适配

昆仑芯 XPU 持续完善大模型场景适配,新增 batched_gemm、CUDA Graph、DeepEP 等能力,并更新 bkcl 通信库以支持 w4a8/w8a8 量化。海光 DCU 侧则通过在 ROCm 上注册 bf16 conv kernel 与适配 HIP native API,进一步提升推理性能。
昆仑芯 XPU(30 项)

5. 编译安装与平台支持

本版本完善编译安装与平台支持,新增 CUDA 13/13.2 的编译与运行支持、Python 3.14 适配、arm64 平台 FlashAttention 构建等能力,并升级 NCCL、protobuf、Sleef 等第三方依赖。
编译与安装(79 项)

CI/构建(75 项)

6. 代码质量与文档

本版本系统性推进代码质量提升,完成 phi_ops 命名空间重构,并进行了大量拼写修正与文档示例格式统一,同时补充了 API 文档与测试用例。
代码风格与重构(265 项)

文档(187 项)

测试(11 项)

7. 贡献者名单

Nyakku Shigure, Ryan, LiYuRio, wanghuancoder, Shuhao Liang, adam-xiaoyao, SUN Dong, Yohanna, Guoxia Wang, fxyfxy777, Nyako Shigure, zhengshengning, Zhan Rongrui, Yuqiang Ge, xingmingyyj, xuanyuanminzheng, Wang Rui, gouzil, ALGO1832, Zx, HydrogenSulfate, Haze188 灏喆, Wennie396, Difer, AlAuAu, Xiangrui Yu, Yuang Liu, Eddie-Wang, XiangzheWang, ShenLiang, HU Shenwei, Chen Kehong, AIbin, Nana, ZhenxingLi, sevenan2, tianhaodongbd, co63oc, ooo oo, sneaxiy, Gu Shiwei, wangbingguang, omoYang, baiyue, zhanghonggeng, Zhaowu Pan, zccjjj, iLeGend, Tianyu Zheng, yangguohao, Zhou Xin, Zhang Ting, feixi, Bohao Fan, baoqiwen, Qianyue He, 苍天荒, zhwesky2010, liuruyan, Tofu, Yichen Zhang, starcrown001, lijin23, Fang Ru, onecatcn, Jia Ningyu, bigwhite37, lizan1999, xinruiM, Leo Guo, Jingzong Liu, yinwei, Lucas, ddchenhao66, 方程, ming1753, umiswing, Runming Xie, Bingoo, Xiaochun Yang, Wenfei (Charles) Qi, Moon, AmeoInoru, Aidenwu0209, cyberslack_lee, AuraWu, Merlin, Rui Huang, qingyun, Xianzheng Pang, xunyoyo, fangfangssj, PlumBlossomMaid, risemeup1, liuhao2638, risemeup1111, Yutian Rao, cutetocute, tianyuzhou668, tianlef, Zhenghai Zhang, zhengzhonghui, ZhouMinhao98, jzhang533, Ray961123, Salman Chishti, paddle-xpu-bot, 盈盈秋水, liang, yyxxddjj, John Feng, SidusAntares, JiaViii, Ricardo-shuo-liu, Alnair, DavidGu, M4jupitercannon, Pandya Mayur

Don't miss a new Paddle release

NewReleases is sending notifications on new releases.