首页
/
资讯
/
Linux 7.4内核引入AMD核显AI性能优化:入门APU吞吐量提升最高23%
Linux 7.4内核引入AMD核显AI性能优化:入门APU吞吐量提升最高23%

Linux 在 7.4 内核中引入了一项 AMD PerfOpt 优化,让 Radeon 核显在本地运行大语言模型时绕过 IOMMU 直接访问系统内存,Llama.cpp 吞吐量最高提升 23%。该补丁由 IOMMU 维护者 Joerg Roedel 于 9 月 24 日合入,AMDGPU 驱动会在检测到 APU 核显工作在 Identity Domain 时自动启用,独立显卡不受影响。

Netflix 开发者 Boqun Feng 在邮件列表中公布的测试数据显示,核显访问动态分配的系统内存(GTT 区域)的速度只有固定预留显存的二分之一到三分之一,PerfOpt 开启后,GTT 访问延迟降至预留显存的 10% 以内。当大语言模型无法完全装入入门笔记本的小容量预留显存时,大部分数据落在 GTT 区域,这正是 PerfOpt 在 AI 场景下效果明显的原因。

Phoronix 基于 Linux 7.3 补丁构建测试内核,对三款 APU 进行了实测:锐龙 AI 9 365 的 AI 性能提升最高 23%,同时提升了吞吐量和首 Token 响应速度。预留显存越少,PerfOpt 收益越大,锐龙 AI 5 340 搭载 Radeon 840M,各项测试均有提升,增幅从 18% 起。旗舰 APU 方面,锐龙 AI Max+ 395 在 Framework Desktop 上配备 64GB LPDDR5-8000,典型提升仅 2% 至 4%,个别测试中未开启 PerfOpt 反而更快。

目前测试仅覆盖 Zen 5 架构搭配 RDNA 3.5 核显的 APU,老芯片如锐龙 7040 或 Steam Deck 的 Van Gogh 定制芯片是否具备该特性尚无定论。PerfOpt 补丁共新增 341 行代码,涉及 8 个文件,最终以何种形式进入正式内核仍有待确认。

对于从事软件开发的团队而言,这一优化意味着在入门级设备上本地部署和调试 AI 模型的门槛进一步降低,尤其适合App开发过程中需要集成大模型能力的场景。南宁本地的软件公司也在密切关注此类底层性能优化,以便为客户提供更高效的企业信息化解决方案。