Step Edge – 阶跃星辰推出的端侧模型全家桶

📰 每日更新AI行业资讯,包含技术突破、产品发布、融资动态等热点内容

Step Edge是什么

Step Edge是阶跃星辰推出的端侧模型全家桶,包含基础模型、Audio、GUI、Gen 四大成员,面向手机与汽车等终端打造。模型通过端云协同架构,让 Agent 在本地实现 0.1 秒级响应,同时保障全模态数据隐私,在 29 项核心评测中取得第一,并配套自研 Step Inference NPU 引擎优化终端推理。

Step Edge

Step Edge的主要功能

  • Step Edge 基础模型:端侧多模态理解与推理,支持文本、图像、视频、OCR、空间理解与工具调用。
  • Step Edge Audio:端侧音频理解与语音识别,覆盖中文、英文等多语种 ASR 与音频问答。
  • Step Edge GUI:端侧 GUI Agent,支持手机与桌面应用的视觉感知、元素定位与自动化操作。
  • Step Edge Gen:端侧图像生成与编辑,支持文生图、图生图及局部编辑,在 OneIG、DPG-Bench 等评测中领先。

Step Edge的技术原理

  • 端云协同架构:简单高频任务由端侧本地处理,复杂长链路推理交由云端完成,实现速度、能力与成本的整体平衡。
  • 全模态本地推理:文本、视觉、语音等多模态数据在终端本地处理,敏感信息不出端,通过本地计算保障隐私安全。
  • Step Inference NPU 引擎:自研终端推理引擎,针对手机、汽车等硬件进行算子与内存优化,降低文本、视觉、语音等输入形态的端到端延迟。
  • 低延迟 Toolcall 执行:端侧本地工具调用延迟低至 0.1 秒,支持高频交互场景下的实时响应,减少对云端链路的依赖。

如何使用Step Edge

Step Edge 全家桶尚未明确开放公测或 API,目前处于发布亮相阶段。

Step Edge的项目地址

  • 项目官网:https://static.stepfun.com/blog/step-edge/

Step Edge的同类竞品对比

对比维度 Step Edge Qwen3-VL
产品形态 端侧模型全家桶(基础+Audio+GUI+Gen) 开源多模态大模型系列
端侧优化 专为终端场景深度优化,配套自研 NPU 引擎 支持端侧部署,但主要面向通用多模态任务
GUI Agent 端侧 GUI 模型,OSWorld 等评测领先 需结合外部框架实现 GUI 自动化
音频能力 独立 Audio 模型,ASR 与音频理解一体化 主要聚焦视觉与文本,音频非核心方向
图像生成 内置 Gen 模型,支持端侧文生图与编辑 以理解为主,生成能力非主打
隐私策略 全模态本地处理,原生端云协同 端侧可运行,但协同策略需自行搭建

Step Edge的应用场景

  • 智能手机助手:端侧实时语音识别与 GUI 自动化操作,离线完成订外卖、发消息、查相册等高频任务。
  • 车载智能座舱:本地处理语音指令与车内视觉感知,保障驾驶数据隐私,实现导航、空调、娱乐的零延迟控制。
  • 端侧图像创作:手机本地文生图与修图,无需上传照片至云端,满足用户即时创作与隐私保护双重需求。
  • 工业终端巡检:在弱网工厂或户外场景,端侧模型本地识别设备故障图像与音频异常,实时上报关键信息。
  • IoT 边缘设备:在智能家居、穿戴设备中部署,本地完成语音唤醒、视觉识别与简单决策,降低云端成本。

0 条评论

点击更换头像
  • 暂无评论,快来发表第一条评论吧!

← 使用左侧菜单导航至其他页面