阶跃星辰Step-3评测:开源多模态推理模型挑战闭源巨头

AI聊天 2026-07-26 3 阅读
阶跃星辰 Step-3 多模态 推理模型 开源AI

Step-3:阶跃星辰的新一代基础大模型

2025年7月25日,阶跃星辰在世界人工智能大会(WAIC)期间正式发布了新一代基础大模型Step-3,并同步开源。Step-3采用MoE(混合专家模型)架构,总参数量321B,激活参数量38B,是一款兼具推理能力和多模态理解的旗舰级开源模型。

阶跃星辰创始人兼CEO姜大昕在发布会上坦言,坚持做基础大模型的公司会越来越少,"这确实是一件非常艰苦的事情,而且投入也非常大"。Step-3的发布,不仅展示了阶跃星辰的技术实力,也为开源社区贡献了一个强大的多模态推理选择。

核心架构与技术特色

MoE架构与参数效率

Step-3采用MoE架构,总参数量321B,但每次推理仅激活38B参数。这种设计使得模型在保持大容量知识储备的同时,推理成本和延迟都控制在合理范围内。38B的激活参数量意味着Step-3在推理效率和输出质量之间找到了一个优秀的平衡点。

与同等参数量的稠密模型相比,Step-3的MoE架构能够在不增加推理成本的情况下,显著提升模型的知识容量和泛化能力。这对于需要处理多样化任务的企业级应用来说尤为重要。

原生多模态视觉理解

Step-3的一大技术亮点是原生多模态视觉理解能力。与需要视觉MCP(Model Context Protocol)中转的方案不同,Step-3能够直接在模型内部处理视觉信息,无需额外的视觉模块调用。这不仅节省了调用开销和延迟,也使得视觉理解与文本推理之间的协同更加紧密。

Step-3支持以下视觉理解能力:

  • PDF解析:直接理解和提取PDF文档中的文字、表格和图形信息
  • 表格理解:解析复杂表格结构,支持跨行跨列的数据理解
  • 图表分析:识别柱状图、折线图、饼图等常见图表并提取数据
  • UI截图理解:分析应用界面截图,理解界面布局和交互元素

这些能力使得Step-3在企业办公场景中特别有用——用户可以直接上传文档和截图让模型分析和处理,无需手动提取信息。

Agent工作流深度兼容

Step-3被定位为"为真实Agent工作流而生的高效多模态Flash模型"。它深度兼容主流Agent框架,在工具调用的稳定性和可靠性方面表现出色。这意味着开发者可以基于Step-3构建可靠的AI智能体,处理多步骤、多工具的复杂任务。

在真实业务场景中,Step-3能够胜任:

  • 办公自动化:文档处理、邮件起草、日程管理
  • 代码开发:代码生成、调试、重构和代码审查
  • Agent工作流:多工具协同、任务分解、结果汇总

性能表现与竞品对比

在各项基准测试中,Step-3展现了旗舰级的研究、文档解析与代码能力。虽然智谱GLM-4.5在发布后三天就以"全球开源SOTA"之名盖过了Step-3的风头,但Step-3在多模态理解方面的原生优势是GLM-4.5所不具备的。

Step-3的多模态能力使它在需要视觉理解的场景中具有独特优势。例如,在处理包含图表和截图的文档分析任务时,Step-3能够同时理解文本和视觉信息,提供更全面的分析结果。

开源策略与生态建设

Step-3已开源,模型权重可供社区使用和研究。阶跃星辰还宣布与上海国投达成深度战略合作,上海国投将参与阶跃星辰新一轮融资。基于当前落地成果和增速,阶跃计划将全年收入冲刺目标定为10亿元。

开源Step-3有助于阶跃星辰在开源社区建立技术声誉,吸引开发者和企业用户。虽然坚持做基础大模型的公司越来越少,但阶跃星辰通过开源策略展现了长期投入的决心。

优势与不足

优势

  • 原生多模态视觉理解,无需视觉MCP中转
  • MoE架构参数效率高,推理成本可控
  • Agent工作流深度兼容,工具调用可靠
  • PDF/表格/图表/UI截图一次解析

不足

  • 综合排名不及同期发布的GLM-4.5
  • 开源社区影响力尚在建设中
  • 多模态生成(图像/视频生成)能力有限

适合人群与总结

Step-3最适合需要多模态文档处理和Agent工作流的企业开发者——特别是需要处理PDF、表格、图表等视觉内容的办公自动化场景。原生视觉理解能力使其在文档分析领域具有独特优势。

对于需要构建AI智能体的开发者来说,Step-3的Agent工作流兼容性和工具调用可靠性是重要加分项。建议结合阶跃开放平台的API和工具链进行评估。更多国产大模型评测,可查看我们的智谱GLM-4.5评测GPT-5评测