一句话结论
Token降价未降低企业AI总账单,边缘算力因隐私和实时性需求,成为混合计算架构中不可替代的一环。
关键要点
- 上下文规模快速扩张,导致即使每百万Token单价持续下降,企业实际AI账单也未必同步减少。
- 视源股份在课堂观察业务中,将涉及未成年人隐私的敏感数据全部在本地进行脱敏处理,本地算力需求稳定在 32—48 TOPS 左右。
- 成都派兹互连的核心算法和图形计算引擎被严格禁止接触外网,部分电子制造客户供应链数据严禁外传,迫使关键业务必须采用本地部署。
- 英特尔指出 Agent 部署过程中大量需要 CPU 承担操作,且物理AI场景同时要求低功耗、防尘及 7×24 小时连续稳定运行。
- 客户对 AI 的采购方式正从单纯直接购买硬件系统,逐渐向租赁、订阅及与业务实际效果挂钩的合作模式倾斜。
背景与事实
视源股份商用显示 BG 副总裁王玉龙指出,企业每月在 AI 上的实际开销极高,原因在于输出良好效果的上下文需求量快速增加。这构成了视源股份与英特尔合作推进边缘侧 AI 算力的核心驱动力。针对零售门店点餐和结算要求实时响应、课堂视频涉及未成年人隐私、制造企业核心算法与供应链数据不能出内网等硬性条件,这些业务即使面对更便宜的云端模型,也不适合将完整工作负载直接迁移至云端。
英特尔行业及解决方案业务部总经理王景佳表示,近年来端侧 AI 部署不仅牵涉成本,更需综合考量服务器资源、时延、响应速度与隐私安全。随着 AI 进入业务,商米科技执行董事陈桂鸿提到门店经营任务算力需求分化:点餐和结算需实时反馈,依赖云端易受网络波动影响;而“智慧店长”分析海量数据无需实时返回,可交由云端执行。这种任务拆解促使本地化部署在特定场景中重新获得经济价值。
在具体行业落地中,视源旗下希沃探索课堂观察时,将音视频采集、结构化提取及脱敏数据提取全部在本地完成,本地设备无需运行超大模型,32—48 TOPS 的算力即可满足。成都派兹互连则因业务涉及 EDA 仿真及图形计算,要求核心系统必须内部署,其最新发布的 AI EDA 一体机采用英特尔 Agent Box 方案,结合锐炫 Pro B70 GPU 实现软硬件整合。同时,派兹互连的客户在前端设计阶段已希望使用高线程数处理器,同步完成电热磁与装配协同仿真,将后端工作前置。
影响分析
对于中文开发者与企业从业者而言,AI 算力的配置逻辑正在发生深刻转变。过去基于单次 API 调用价格评估 AI 项目可行性的方法已失效,随着 Agent 持续执行任务,总成本必须结合调用次数、上下文规模及任务并发量进行核算。这意味着在实际开发架构时,不能默认将一切任务推给云端,而必须在系统设计中明确“哪些计算必须靠近现场,哪些可以上云”。此外,面对隐私合规与网络断联风险,开发者在接入通用模型前,必须预留本地算力用于数据脱敏与实时响应,这要求从业者不仅精通模型调用,还需具备端、边、云协同调度及硬件适配的工程能力。
适用边界
上述混合算力架构的结论高度依赖“强实时性要求”和“数据严格不出域”两大前提。对于网络覆盖良好、无敏感数据出境风险且对时延不敏感的通用文本生成、短剧创作等场景,单纯依赖云端低成本大模型依然具备绝对成本优势,边缘部署反而会显著增加企业的硬件采购与运维开销,此时将工作负载强制拆解至本地便不具备经济合理性。
孤本观察
行业内的核心矛盾已不再是能否获取算力,而是能否精准计算“隐私安全、实时响应”与“算力投入”的边际收益,从而在混合架构中设计出最优的算力调度边界。





常见问题
视源股份在课堂观察业务中,本地算力需求具体是多少?
本地算力需求稳定在 32—48 TOPS 左右。
成都派兹互连最新发布的 AI EDA 一体机采用了哪些核心硬件组件?
采用英特尔 Agent Box 方案,结合锐炫 Pro B70 GPU 实现软硬件整合。
英特尔指出 Agent 部署过程中 CPU 主要承担什么操作?
Agent 部署过程中大量需要 CPU 承担操作。
哪些场景下单纯依赖云端大模型仍具备成本优势,而不适合边缘部署?
网络覆盖良好、无敏感数据出境风险且对时延不敏感的通用文本生成、短剧创作等场景。
来源:InfoQ 中文 AI