7月13日,阶跃星辰发布首款智能体手机 STEPX Neo;四天后的世界人工智能大会(WAIC)上,努比亚又亮出号称全球首款量产的 AI 智能体手机 NaviX Ultra——再加上更早搭载豆包大模型的一批机型,从大模型公司到传统硬件厂商,都想要把AI全天候部署到消费者身边。
不过,同样是7x24小时在线,AI智能体手机带来的将是用户体验和性能比拼的颠覆性变化——传统手机数据流由用户触发,而智能体手机的数据流则由大模型持续驱动。过去的手机,App是被动的——你点一下,数据才动一下;智能体手机里,却有一个模型在后台持续地运行、持续地传输数据。载体还是那台手机,但数据流动的逻辑被彻底改写了。而这套新逻辑,将用户体验的决定权从单一芯片转向手机内部的五条接口通道:只有当这些通道既能保持高带宽,又以极低能耗运行,手机端的AI功能才可能顺畅。
端侧AI会卡在哪里?
端侧 AI 的难点,本质上都来自一个核心矛盾:模型想要"聪明",但设备的内存、算力、功耗、散热都是硬约束。几乎所有具体困难都是这个矛盾的衍生,而第一堵墙并不是算力,而是数据流动的瓶颈。
以大模型终端推理为例:一个70亿参数(7B)模型,量化到4-bit大约3.5GB;要实现20 token/s的流畅对话,仅权重读取就需要3.5GB×20≈70GB/s的持续带宽。这已几乎逼近今天旗舰手机的峰值内存带宽(以16GB LPDDR5X配置为例),还未计算App占用内存的情况。
除了权重这笔账,模型每多记住一句话,就要多存一份KV cache:以采用GQA的7B级模型为例,每个token的KV cache约100–130KB,4K上下文就是500MB量级,8K直接逼近 1GB——而且它不只占内存,解码时每生成一个token都要把整个KV cache重新读一遍。权重是固定成本,3.5GB摆在那里不动;KV cache是变动成本,随对话长度线性增长。智能体的长期记忆和跨App多轮任务,只会让这笔账单调上涨。因此,端侧AI面对的并不是一个固定带宽需求,而是一个持续增长的带宽需求。
端侧AI与云端同源,都是靠不停搬运权重来输出答案,但约束条件有天壤之别:数据中心可以用千瓦级功耗、液冷、机柜去换更高带宽,而手机一分一毫都要算入电池与握持温度。正是这一决定性差异,把手机里所有数据通道,或者说接口的考核指标都调换了顺序。
数据走一圈:五条通道的新考题
在智能体手机中,数据从传感器到CPU/GPU到屏幕输出走过的路径可大致分为五条并行通道。主干道是内存,其它四条(存储、感知、显示、扩展)为支线。
内存(LPDDR)——考题:烫不烫手。
LPDDR承载第一道数据流动压力。JEDEC已发布LPDDR6标准中,起始速率10.67Gbps,峰值可达14.4Gbps。但带宽只是入场券,在被动散热的约束下,真正的第一指标已经从“峰值带宽”变成“pJ/bit”,每搬运一个比特要花的能量都在直接转化为手感温度和电池消耗。而在时间维度,智能体的常驻特性也意味着内存不再是简单的“待机”。 LPDDR6强化了DVFSL(低功耗动态电压频率调节),在低频段直接降低VDD2供电;配合轻载时只启用单个子通道的 Dynamic Efficiency模式,构成一套层次化的低功耗组合拳。智能体后台常驻的大部分时间恰恰就是低带宽状态,这套组合能否高效切换,直接决定续航。
LPDDR 的带宽和容量终将见顶,业界已经开始探索“移动HBM”的思路:例如封装内堆叠多层DRAM,或外挂IO Die与LPDDR并用等,在有限封装面积内再度突破带宽。
内存是整条数据流的主干道,端侧 AI 的第一道坎就在这里。
存储(NAND / ONFI)——考题:“多久响应”。
智能体手机往往是多模态并行,对话、视觉、语音切换时要把几个GB的权重从闪存重新加载进内存。UFS决定的是主机与存储设备之间的速率,而存储设备内部的控制器与NAND颗粒之间还有一层ONFI——模型加载的实际延迟,两层都要算。而ONFI也在不断升级,从底层为模型加载提供更高吞吐、更短延迟。最新ONFI 6.0规范将面向NAND颗粒的NV-LPDDR4 (LTT)速度推至4800MT/s,并新增由独立VccQL供电的PI-LTT接口模式,在高速下进一步压低接口功耗。
感知(MIPI CSI-2 / I3C)——考题:Always-On但省电。
AI手机必须"眼睛常开",而这条常驻链路的功耗预算只有毫瓦级。CSI-2自v4.0起引入 Always-On Sentinel Conduit(AOSC):超低功耗图像传感器经MIPI I3C总线持续把图像帧送给视觉处理器,只在事件发生时才唤醒主CPU。2025年12月的v4.2又标准化了事件相机的协议支持——它只在像素亮度变化时输出事件,数据量取决于场景变了多少而非帧率。对一个绝大多数时间面对静止画面的常驻智能体,这是"省"的极致:不是把管子做粗,而是让不必搬的数据根本不产生。v4.2还补上了D-PHY嵌入式时钟模式(ECM)支持,把时钟嵌入数据流由接收端CDR恢复,腾出的时钟lane可改作数据lane——但协议只规定模式能否存在,能否在目标速率下把CDR 做稳、功耗压住,全看PHY。
显示(MIPI DSI-2)——考题:界面静止时,链路能不能闲下来。
智能体常驻会显著拉长亮屏与高刷时长,而显示子系统本就是整机功耗大头——它省下的每一毫瓦,都是给NPU腾出来的热预算。DSI-2 v2.0引入的video-to-command mode正对这个场景:智能体在后台干活时界面大多是静止的,链路可以从持续逐帧推流的视频模式平滑切到命令模式,只在内容变化时推送;需要流畅交互时再切回视频模式。配合能让画面在没有主机定时刷新的情况下长时间保持的自适应刷新面板(ARP),以及DSC/VDC-M压缩与LTPO,显示链路的考核目标就从“撑住峰值分辨率和刷新率”,变成了“在没什么在变的时候尽可能什么都不传”。
扩展(USB4 / PCIe)——考题:空闲时能不能真的关掉。
端侧AI的算力不必全塞在手机里。往外看,AI眼镜是已经落地的形态:眼镜端只做感知和编码,靠USB-C链路把重活交给口袋里的手机,再把结果送回眼前。往内看,智能体的端云协同让 SoC与外挂基带之间的片间链路(通常是PCIe)长期处于活跃状态。两条链路的考题是同一个形状:绝大多数时间都在空闲,却必须随时能被叫醒。USB4 v2用PAM-3编码把带宽推到 80Gbps(非对称模式下单向可达120Gbps),同时规范了CLx链路低功耗状态与休眠唤醒机制;PCIe的L1 PM Substates则允许在链路空闲时进一步关掉更多电路。带宽是入场券,真正决定体验的是空闲功耗压得有多低、唤醒延迟收得有多短。
上述各通道各有不同侧重点,但共同点是:过去衡量接口的“峰值带宽”指标已不再足够,端侧AI设备更关注每比特的能量成本、整体面积/功耗比、以及多态休眠切换延迟。
换一把尺子:端侧接口比的不是“快”,是“省”
从摄像头进来的一侧和往屏幕出去的一侧,标准在做的其实是同一件事:让不必搬的数据根本不产生。约束条件的变化,把接口的考核维度整个换了一遍:
能量。手机没有主动散热,接口每消耗一焦耳,都变成握在手里的温度和掉下去的电。衡量终端体验的起点从“峰值带宽有多少Gbps”,变成了“每搬一个比特要烧多少pJ”。
时间。智能体不只是“用时才唤醒”,而是后台常驻。接口功耗不能只算传输时刻,要考虑24小时内深睡、唤醒、满速的加权功耗,以及从休眠到满速的毫秒级唤醒延迟——这个数字正在从毫秒级被压向微秒。
安全。当模型权重成为设备上最值钱的资产,接口链路上的保护就从“可选项”变成了“必选项” ——LPDDR6本身就定义了可编程链路保护方案与on-die ECC。而这些机制自身又要消耗额外的功耗和带宽,最终还是绕回到能效这道总约束上。
说到底,端侧AI的接口性能比拼,已经不是“谁更快”的老游戏,而是“谁能在能量、时间、安全三个维度上同时达标”的新游戏。
而无论是LPDDR、ONFI、MIPI、USB还是PCIe,这些接口标准最终都要落到PHY的具体实现上。协议决定的是"能不能互通",PHY决定的是"能不能把性能跑出来,同时把功耗压下去"。对于端侧AI而言,这一层正在成为接口能力真正拉开差距的地方。
AI 手机、AI 眼镜、AI PC 的爆发,从来不是某一颗芯片的独角戏,而是一整套接口能力的机会——从内存的 LPDDR、存储的 ONFI,到感知与显示的 MIPI、对外的 USB 与 PCIe,每一条通道都在被智能体重新出题。
当算力的增长开始被数据搬运拖住,决定你口袋里那个智能体好不好用的,可能正是这几条你从没留意过的接口?接口性能,正在悄悄成为端侧AI体验的那条隐形主线。