
云端推理虽然强大,却绕不开三座大山:延迟、成本与隐私。当手机 NPU 算力逼近入门服务器、当用户对"数据不出设备"的要求越来越高,把大模型装进终端,从炫技变成了刚需。
纯端侧做不了所有事。务实架构是"端侧小模型 + 云端大模型"的分层调度:高频、隐私、低延迟任务在本地闭环;复杂推理、长上下文回落到云。路由器的智能,决定了体验与成本的平衡。
端侧大模型不是要把云取代,而是把"确定能本地完成的事"留在本地,把算力和隐私成本一次性算清楚。
先定义"必须离线可用"的最小场景,再倒推模型规模与压缩方案;不要盲目追求参数量,任务达成率与首 token 延迟才是用户能感知的指标。
