字节GR-3发布:具身智能的"准商用"突破
2026年7月22日,字节跳动Seed团队正式发布通用机器人模型GR-3——一款全新的视觉语言动作模型(VLA),标志着具身智能从实验室Demo阶段推进到"准商用"区间。GR-3规模40亿参数,核心突破在于"三元训练"范式:网页Vision-Language语料2.8B token + 机器人真实轨迹101小时 + VR人体动作演示68小时。
核心突破:少样本迁移的"十条示范"奇迹
与传统需要大量机器人轨迹训练的VLA模型不同,GR-3通过少量人类数据即可实现高效微调。只需10条人类示范,GR-3就能把"请把桌面收拾干净"这样的模糊指令分解为17步动作序列,并在双臂移动机器人ByteMini上实现77%的成功率——而当前SOTA模型成功率仅约40%。
这一少样本迁移能力的意义远超技术层面。传统机器人部署需要数月的轨迹数据采集和训练,而GR-3让"教机器人新任务"变得像"教实习生新流程"一样简单:展示几遍,它就能学会。
ByteMini机器人本体:22自由度的灵活躯体
GR-3不是孤立的模型,字节团队为其打造了通用双臂移动机器人ByteMini作为"灵活躯体"。ByteMini拥有22个全身自由度以及手腕球角设计,可在狭小空间中完成各种精细操作。它能执行双手协同操作、柔性物体操作,以及融合底盘移动的全身操作——从叠衣服到擦桌子,从搬运物品到精密装配。
更令人惊喜的是推理效率:GR-3仅需6秒即可完成视觉-语言-策略前向推理,端到端能耗低至28W。这意味着GR-3+ByteMini的组合不仅"能做",而且"做得快、做得省"。
技术架构:行为微调蒸馏+动作层次化规划
GR-3的核心技术包括行为微调蒸馏和动作层次化规划两个关键模块。行为微调蒸馏让模型从大规模网络视觉语言数据中学习通用理解能力,再通过少量真实轨迹和VR演示数据蒸馏出精确的动作执行能力。动作层次化规划则让模型能将长程任务自动分解为子任务序列,逐层规划执行路径。
这种架构让GR-3实现了"感知-理解-规划-执行"的闭环能力链:看到桌面(感知),理解"收拾干净"的含义(理解),规划17步动作序列(规划),逐步执行每个动作(执行)。
行业影响:具身智能的商业化加速
业内评价认为,GR-3把具身AI从Demo阶段推进到"准商用"区间:一是提前验证少样本指令迁移能力;二是通过VLA统一表征打通感知与控制;三是拓展了AI从数字内容到物理场景的想象空间。大疆、科沃斯等硬件厂商已在内部评估迁移价值。
更重要的是,GR-3开启了"AI+硬件服务费"的商业模式——机器人企业按调用量向模型侧付费,类似当前AI编程工具的Token计费模式。这让具身智能的商业闭环第一次变得清晰可见。
对比与定位
与OpenAI的GPT-5.6 Physical、Google DeepMind的RT-3等海外VLA模型相比,GR-3的参数规模虽小(40亿 vs 数百亿),但在少样本迁移效率上展现出独特优势。它不需要海量机器人训练数据,10条示范即可迁移新任务——这对商用部署的实用性至关重要。
适合人群与展望
GR-3目前主要面向机器人研发团队和具身智能研究者,未来有望与DeepSeek等国产大模型生态深度整合。字节团队透露后续研究计划包括扩大模型规模和训练数据量、引入强化学习训练,以及探索更多商用场景。
GR-3的发布意味着:在文本、图像、视频之后,"文生动作"终于翻越了平台期——机器人真正听懂了人话,也真正动了起来。