vivo BlueLM 3.5 Nano 3B 登顶 SuperCLUE 手机端侧模型榜,89.86 分接近云端参考模型
SuperCLUE 最新 OnDevice 手机端侧大模型测评中,vivo 的 BlueLM 3.5 Nano 3B 以 89.86 分位列端侧模型综合第一。Qwen3.5 9B 和 Qwen3.5 4B 分别以 87.82 分、85.16 分排在其后。
这份测评聚焦可在手机本地运行的模型,云端模型只作为参照,并不参与端侧排名。作为参考,Gemini 3.6 Flash、豆包 Doubao Seed 2.1 Pro 和 Qwen3.8 Max 的分数分别为 93.64、92.99 和 92.25。BlueLM 3.5 Nano 3B 与最高参考分相差 3.78 分,但这不等同于它在所有真实任务中已经与云端旗舰模型对等。
更值得关注的是参数规模。3B 模型需要在手机的算力、内存和功耗约束下运行,能取得这一成绩,说明端侧模型在特定评测集上的压缩、推理和软硬件协同正在快速进步。对于离线文本处理、系统级助手、相册检索和部分图像理解等任务,本地模型有机会减少等待时间,也降低了必须把内容发送到云端的需求。
但“端侧运行”不自动等于所有数据都不会出设备。最终体验取决于手机系统和具体功能是否混合调用云端服务,开发者和用户仍需要查看功能说明与隐私政策。复杂推理、长上下文、多步骤 Agent 任务,以及持续更新的知识类需求,云端模型仍有明显优势。
榜单成绩可以说明模型在统一测试条件下的能力上限,却不能替代真实体验。端侧 AI 接下来要比的,不只是单项跑分,还包括首 Token 延迟、功耗、离线成功率、跨应用协作能力,以及在不同手机硬件上的稳定性。
SuperCLUE 最新 OnDevice 手机端侧大模型测评中,vivo 的 BlueLM 3.5 Nano 3B 以 89.86 分位列端侧模型综合第一。Qwen3.5 9B 和 Qwen3.5 4B 分别以 87.82 分、85.16 分排在其后。
这份测评聚焦可在手机本地运行的模型,云端模型只作为参照,并不参与端侧排名。作为参考,Gemini 3.6 Flash、豆包 Doubao Seed 2.1 Pro 和 Qwen3.8 Max 的分数分别为 93.64、92.99 和 92.25。BlueLM 3.5 Nano 3B 与最高参考分相差 3.78 分,但这不等同于它在所有真实任务中已经与云端旗舰模型对等。
更值得关注的是参数规模。3B 模型需要在手机的算力、内存和功耗约束下运行,能取得这一成绩,说明端侧模型在特定评测集上的压缩、推理和软硬件协同正在快速进步。对于离线文本处理、系统级助手、相册检索和部分图像理解等任务,本地模型有机会减少等待时间,也降低了必须把内容发送到云端的需求。
但“端侧运行”不自动等于所有数据都不会出设备。最终体验取决于手机系统和具体功能是否混合调用云端服务,开发者和用户仍需要查看功能说明与隐私政策。复杂推理、长上下文、多步骤 Agent 任务,以及持续更新的知识类需求,云端模型仍有明显优势。
榜单成绩可以说明模型在统一测试条件下的能力上限,却不能替代真实体验。端侧 AI 接下来要比的,不只是单项跑分,还包括首 Token 延迟、功耗、离线成功率、跨应用协作能力,以及在不同手机硬件上的稳定性。