孤本网
/ 1 阅读
0
0

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

一句话结论

Imagination E 系列 GPU 实现图形、计算与 AI 统一架构,典型边缘语言模型预填充性能较 D 系列提升 4.7 倍。

关键要点

  • 相比上一代 D 系列,E 系列在典型边缘语言模型上的预填充性能提升 4.7 倍,矩阵乘法(GEMM)内核速度提升 4.8 倍,二维卷积(Conv2D)内核速度提升 4.4 倍。
  • 在 Qwen 3.5 4B 模型典型工作负载下,1.5GHz 四核 E 系列 GPU 可实现 0.2 秒首次 Token 生成时间,解码吞吐量达每秒 150 个 Token。
  • 全新神经超分辨率(NSR)采用单次处理与网络自压缩技术,可移除约 65% 冗余权重,内存带宽消耗较原生渲染减半,1GHz 单核下 540p 到 1080p 操作延迟低至 2.3 毫秒。
  • E 系列图形性能较上一代提升最高达 54%,每瓦性能提升最高 39%,支持 DirectX 12 FL11_0,四核配置在部分 AAA 级桌面游戏中可超过 60fps。
  • 首批基于 E 系列的芯片预计于 2026 年下半年完成流片,目前正将优化后的 Llama.cpp 后端贡献至上游开源项目。

背景与事实

2026 年 9 月 21 日,Imagination Technologies 公布了其 E 系列 GPU IP 的首批性能数据与演示结果,并同步推出神经超分辨率(NSR,Neural Super Resolution)AI 加速超分辨率方案。这套方案将 E 系列的矩阵加速器(Matrix Accelerator)深度集成进图形渲染管线,采用时序超分辨率单次处理架构,配合专有网络自压缩技术移除约 65% 的冗余神经网络权重,以降低功耗并减少内存带宽压力。NSR 作为库功能集成于 PowerVR SDK 中,并与 Unreal Engine 和 Godot 游戏引擎完成集成适配。

E 系列 GPU 于 2025 年首次发布,核心定位是将可编程 AI 加速高效集成进 GPU 渲染管线。在计算能力层面,E 系列支持 BF16、FP4 和 MX 等高精度与低精度数据格式,采用标准 GPU 编程模型与行业 API。针对边缘 AI 模型持续演进的现实需求,这种通用可编程架构使开发者无需等待硬件迭代即可实现新算子。在具体性能指标上,针对 Qwen 3.5 4B 模型,1.5GHz 频点的四核 E 系列 GPU 实现了 0.2 秒的首次 Token 生成时间与每秒 150 Token 的解码吞吐量。

在基础计算操作方面,E 系列针对人工智能、计算机视觉、信号处理和通用计算中的核心运算进行了全面优化。与 D 系列同类产品相比,E 系列运行二维卷积内核速度快 4.4 倍,运行通用矩阵乘法内核速度快 4.8 倍。在纯矩阵乘法工作负载下,GPU 利用率最高可达 89%。图形处理方面,E 系列新增对 DirectX 12 FL11_0 的支持,实际游戏工作负载性能较上一代提升最高 54%,每瓦性能提升最高 39%。四核配置在部分 AAA 级桌面游戏中可实现超过 60fps 的帧率。

Imagination 正在推进软件生态建设,目前已将经过优化的 Llama.cpp 后端贡献至上游开源项目,并计划后续提供原生 PyTorch 和 ONNX Runtime 支持。供应链端,E 系列提供覆盖智能手机到高性能系统等多种配置,已有数家合作伙伴获得技术授权,首批基于 E 系列的芯片预计于 2026 年下半年完成流片。象帝先计算技术有限公司总经理张珩指出,Imagination 与其共享将高性能渲染能力带给更广泛中国客户的愿景;W4 Games 与 Godot 引擎公司技术总监 Clay John 表示,针对硬件优化的超分辨率方案改变了开发者在视觉质量与性能之间的传统权衡。

影响分析

对于中文开发者与边缘 AI 从业者而言,这一架构路线的实际影响主要体现在研发成本与适配周期的重新评估上。过去为不同 AI 模型单独开发 NPU 或定制加速模块的策略面临硬件闲置风险,而 E 系列的统一架构允许团队在单一软件栈内同时部署图形渲染、视觉推理与语言生成任务。以 Qwen 3.5 4B 模型为例,0.2 秒首次 Token 生成和每秒 150 Token 解码的指标意味着端侧智能助手交互体验将向实时化逼近。NSR 方案将内存带宽消耗减半的特性对移动端与嵌入式设备具有直接价值,在带宽受限的芯片平台上可显著降低功耗预算。Llama.cpp 后端进入上游开源项目后,国内基于 LLaMA 架构的端侧部署团队可直接复用官方优化路径,无需重复造轮子。

适用边界

上述性能数据基于 1.5GHz 频点、四核配置的 Qwen 3.5 4B 模型得出,直接外推至高算力云端或多模态大模型场景不适用。NSR 方案依赖 Imagination 专有网络自压缩技术与时序单次处理架构,跨平台移植至其他厂商 GPU 或 NPU 时,65% 权重压缩率与 2.3 毫秒延迟指标无法保证。此外,首批芯片尚未流片,上述数据为 IP 级仿真结果,实际量产芯片在先进制程下的功耗与发热表现仍需等待流片验证。

孤本观察

在边缘处理器日益趋同的当下,Imagination 选择以 GPU 统一图形、计算与 AI 三条通路的路线,本质上是用软件栈的通用性对冲硬件碎片化的风险。判断这一路线能否在中国市场落地,关键节点在于流片后的实际制程功耗比与 Llama.cpp 上游合入后的社区维护质量。

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

Imagination 发布 E 系列 GPU 新数据:单架构覆盖图形、计算与 AI,预填充性能提升 4.7 倍

常见问题

E系列 GPU 相比 D 系列在预填充和矩阵乘法性能上提升了多少倍?

典型边缘语言模型预填充性能提升 4.7 倍,矩阵乘法(GEMM)内核速度提升 4.8 倍。

在 Qwen 3.5 4B 模型下,四核 E 系列 GPU 的首次 Token 生成时间和解码吞吐量是多少?

首次 Token 生成时间为 0.2 秒,解码吞吐量达每秒 150 个 Token。

神经超分辨率(NSR)技术能移除多少冗余权重,内存带宽消耗有何变化?

可移除约 65% 冗余权重,内存带宽消耗较原生渲染减半。

首批基于 E 系列的芯片预计何时完成流片?

预计于 2026 年下半年完成流片。

E 系列 GPU 在图形性能方面相比上一代有哪些提升?

图形性能提升最高达 54%,每瓦性能提升最高 39%。

来源:InfoQ 中文 AI


评论