孤本网
/ 0 阅读
0

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

一句话结论

Imagination E系列GPU通过强化低精度计算与神经核架构,将游戏AI超分耗时压至2.3毫秒,并使LLM Prefill性能提升4.7倍。

关键要点

  • E系列单核GPU将画面从540p提升至1080p耗时2.3毫秒,拉升至4K时带宽消耗最高降低54%。
  • E系列首次引入MXFP8、MXFP4低精度格式,Prefill阶段性能较上一代提升4.7倍。
  • 卷积计算性能提升4.4倍,GPU每瓦性能最高提升39%,支持最高768GB/s读取带宽。
  • 开发者可通过OpenCL、Vulkan、Llama.cpp、ONNX、PyTorch编写内核并复用跨代软件栈。
  • E系列将矩阵计算深度整合进着色器执行体系,配合TBDR分块渲染减少片外数据搬运。

背景与事实

2026年9月,Imagination Technologies在E系列GPU IP产品展示会上发布了新一代可编程架构。该系统由首席营收官Jake Kochnowicz主导介绍,CEO Markus Mosen总结其定位为图形、计算和AI功能整合的平台型处理器。Imagination深耕GPU IP三十余年,此前曾推出独立神经网络加速器,但因模型适配和软件维护压力过大,已将AI战略重心收回至通用性更强的GPU体系。

E系列在硬件层面强化了矩阵乘法、低精度计算与卷积运算能力。其引入的Neural Core(神经核)让GPU独自承担图形计算和矩阵运算,避免传统异构路径中GPU渲染后需写入共享DDR内存再由NPU读回的长距离数据搬运。结合TBDR(Tile-Based Deferred Rendering)处理,屏幕被拆分为大量Tile逐块渲染,中间数据更多保留在片上。配合Imagination自研神经超分辨率算法与压缩技术,单次神经网络处理中权重降低超50%,显著减少模型存储与读取数据量。

在AI推理侧,E系列首次引入LLM和大模型推理常用的MXFP8、MXFP4低精度格式。低精度矩阵计算直接提升Prefill吞吐,缓解Decode阶段带宽压力。该系统通过AXI接口接入SoC内存子系统,适配LPDDR、GDDR和HBM等不同内存类型,最高可消耗768GB/s的读取带宽。与此同时,针对视觉识别、感知和图像处理等多模态AI任务,E系列同步提升卷积计算能力,性能达到上一代的4.4倍。

软件生态方面,开发者可继续使用OpenCL、Vulkan编写Kernel,也可接入Llama.cpp、ONNX、PyTorch等上层框架。Imagination强调跨代统一的软件栈设计,使模型优化成果能够在新旧GPU间迁移复用,降低嵌入式SoC客户为不同加速器重复开发软件的成本。部分客户已明确询问GPU能否接手原本交给NPU的工作,以简化整体软件维护流程。

影响分析

这是针对中文AI开发者与SoC设计从业者的直接影响判断。对端侧AI应用开发者而言,E系列将图形渲染与LLM推理整合在同一GPU架构中,意味着团队无需再维护两套独立的加速软件栈。以游戏或智能座舱场景为例,使用同一GPU同时完成AI超分与多模态感知,可减少异构架构中GPU与NPU之间的数据拷贝与调度开销。低精度格式支持直接降低模型部署对内存带宽的要求,使768GB/s带宽配置下的端侧设备在有限功耗下运行更大参数量的LLM成为可能。

对芯片设计厂商而言,软件连续性降低了跨代升级成本。过去每更换一代GPU或独立NPU,算子库与模型适配层往往需要重新开发;E系列通过保留OpenCL、Vulkan及主流框架接口,使已有优化代码可直接迁移。在自动驾驶、机器人等复杂异构终端中,GPU作为融合计算一环的定位更加清晰——它不再试图替代CPU的任务调度或专用NPU的特定加速功能,而是通过共享内存、硬件mailbox机制与其他处理器高效协作,开发者可据此制定更合理的SoC资源分配策略。

适用边界

该性能结论建立在E系列GPU独立承担图形与AI计算、配合TBDR分块渲染及自研神经超分算法的前提下。若SoC架构采用传统“GPU渲染+NPU超分”的异构路径,或模型推理依赖极高精度格式(如FP32全精度),则2.3毫秒超分耗时与4.7倍Prefill提升无法直接复现。此外,768GB/s读取带宽上限取决于最终采用的内存类型、控制器及SoC整体配置,实际系统若未配备HBM或相应高速内存,带宽将低于该数值。E系列对多模态卷积4.4倍提升的结论,同样以采用对应低精度量化和TBDR处理为条件,传统全精度卷积路径下性能增益幅度将不同。

孤本观察

编辑观察:Imagination此轮产品发布的核心信号并非单纯追求单项算力峰值,而是试图用“同一套软件栈+可编程硬件”降低端侧AI的系统级集成成本。这是判断,基于来源中CEO与COO反复强调的软件维护负担与跨代复用逻辑,而非新增算力指标本身。

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

Imagination E系列GPU性能实测:AI超分2.3毫秒翻倍分辨率,Prefill提速4.7倍

常见问题

Imagination E系列GPU将540p画面提升至1080p及拉升至4K时的具体耗时与带宽消耗变化是多少?

将画面从540p提升至1080p耗时2.3毫秒;拉升至4K时,带宽消耗最高降低54%。

E系列首次引入的低精度格式是什么,其Prefill性能提升幅度及卷积计算性能提升倍数分别是多少?

首次引入MXFP8、MXFP4低精度格式。Prefill性能较上一代提升4.7倍,卷积计算性能提升4.4倍。

E系列GPU支持的最大读取带宽是多少,且通过何种接口接入SoC内存子系统?

支持最高768GB/s读取带宽,通过AXI接口接入SoC内存子系统,适配LPDDR、GDDR和HBM等内存类型。

开发者可以使用哪些编程接口和框架为E系列GPU编写内核,是否支持跨代复用?

可使用OpenCL、Vulkan、Llama.cpp、ONNX、PyTorch编写内核,且支持跨代软件栈复用。

在何种SoC架构或模型精度条件下,E系列的2.3毫秒超分耗时与4.7倍Prefill提升无法复现?

若SoC采用“GPU渲染+NPU超分”异构路径,或模型推理依赖FP32全精度格式,则无法直接复现该性能指标。

来源:雷峰网