直接答案:YD/T 6770—2026 不是国家标准(GB/GB/T),而是现行的推荐性通信行业方法标准,名称为《人工智能 关键基础技术 具身智能基准测试方法》,备案号 106194—2026。全国行业标准信息服务平台显示,它由工业和信息化部批准发布,2026 年 3 月 11 日发布、2026 年 6 月 1 日实施,适用于单个具身智能系统在仿真环境和真实环境中的感知—决策—执行端到端基准测试。它给出了环境设置、任务库、测试过程和指标计算的共同框架,但不等于政府替某款机器人背书,也不会自动生成厂商排行榜。
先分清:行业标准、国家标准和标准计划
“首份国标”是原稿最关键的事实错误。标准编号本身已经提供了判断线索:YD/T 是推荐性通信行业标准代号;推荐性国家标准通常使用 GB/T。国家标准信息公共服务平台还可以检索到具身智能模型、系统、训练和数据等方向的国家标准计划,但“已经下达计划”不等于“标准已经发布实施”。写新闻、做采购或参与招投标时,应把三种状态分开。
《中华人民共和国标准化法》第十一条把推荐性国家标准交由国务院标准化行政主管部门制定,第十二条则规定:对没有推荐性国家标准、需要在全国某个行业范围统一的技术要求,可以制定行业标准,由国务院有关行政主管部门制定并备案。标准层级取决于法定类型、编号和公开状态,不取决于媒体标题中的“首个”。
| 文件类型 | 常见编号 | YD/T 6770—2026 属于吗 | 使用时应怎么写 |
|---|---|---|---|
| 国家标准 | GB、GB/T | 不属于 | 只有正式编号、状态和公开页都相符时,才能称“国标” |
| 行业标准 | YD、YD/T 等 | 属于推荐性通信行业标准 | 写明发布部门、标准号、发布日期和实施日期 |
| 国家标准计划 | 计划号,后续可能形成 GB/T | 不是同一文件 | 称“计划项目”或“正在研制”,不要提前写成已发布标准 |
| 团体规范或企业方法 | T/… 或企业内部编号 | 不属于 | 可以作为补充方法,但不能冒充国家或行业标准 |
截至 2026 年 7 月 18 日,全国行业标准信息服务平台仍将 YD/T 6770—2026 标为“现行”,发布日期为 2026 年 3 月 11 日,实施日期为 6 月 1 日,技术归口为中国通信标准化协会,批准发布部门为工业和信息化部,标准类别为方法标准。至于“首份”必须加完整限定语:公开政府解读将它称为具身智能领域首个行业标准,而不是首个国家标准。更不能把尚在推进的国家标准计划与这份已实施的行业标准合并成一个故事。
先做标准身份核验,再谈“符合”
采购方收到标准号、检测报告或供应商声明时,第一步不是抄写标题,而是建立一张可追溯的“标准身份卡”。至少同时核对标准号、中文名称、标准类型、状态、发布与实施日期、批准部门、技术归口、备案号和适用范围。任何一个字段与公开平台不一致,都应暂停把它写入招标评分或对外宣传,回到原始页面确认是否存在同名文件、修订单、替代标准或录入错误。
| 身份字段 | YD/T 6770—2026 的公开记录 | 采购方要保存的证据 | 停止条件 |
|---|---|---|---|
| 标准类型与状态 | 推荐性通信行业标准;现行 | 全国行业标准信息服务平台详情页快照、访问日期 | 把 YD/T 写成 GB/T,或平台状态已变化 |
| 标准名称 | 《人工智能 关键基础技术 具身智能基准测试方法》 | 完整名称与标准号,不使用自造简称代替合同标的 | 报告引用的是相近名称或另一标准 |
| 发布日期/实施日期 | 2026-03-11 / 2026-06-01 | 标准平台字段和合同采用日期 | 测试发生时采用版本尚未实施,且合同没有另行约定 |
| 批准/归口 | 工业和信息化部 / 中国通信标准化协会 | 公开字段与报告引用页 | 供应商用非官方文章替代标准身份来源 |
| 备案号 | 106194—2026 | 备案号、报告页码与测试对象版本 | 备案号缺失或与标准号无法对应 |
| 适用范围 | 单个具身智能系统;仿真与真实环境;感知—决策—执行链路 | 本项目对象、任务与标准范围的对应说明 | 拿部件测试、演示视频或模型单项分数代替系统闭环测试 |
身份卡只能证明“引用的是哪份文件”,不能证明某产品已经通过测试。标准全文可能受版权和获取渠道约束,项目团队应从合法渠道取得适用版本,把采用的条款号和必要附件放进受控文档库;本文的公开信息摘要不能代替正式文本。若平台状态、标准版本或合同引用发生变化,身份卡也要重新签署,而不是沿用旧网页截图。
推荐性行业标准是不是“可以完全不管”
也不是。市场监管总局《行业标准管理办法》明确,行业标准原则上是推荐性标准,用于没有推荐性国家标准、又需要在全国某个行业统一的技术要求。推荐性不等于自动强制,但国家标准委对《标准化法》第二条的释义说明,当推荐性标准被法规引用、企业公开声明执行,或被合同双方作为交付依据时,会产生相应约束。
| 使用情形 | 对项目的实际影响 | 建议文件写法 |
|---|---|---|
| 只作为研发参考 | 用于统一任务和记录语言,不自动形成验收结论 | “参照 YD/T 6770—2026 设计测试” |
| 招标或合同明确引用 | 成为双方约定的交付依据之一 | 同时附任务、阈值、版本和争议处理 |
| 企业公开声明符合 | 声明内容需要与实际产品和证据一致 | 限定型号、软件版本、环境和报告 |
| 法规或强制性要求引用 | 按具体引用条款执行 | 注明法规名称、条款和适用范围 |
因此,采购文件不能只写“必须符合本标准”就结束。它应进一步说明是全文采用、部分条款采用,还是仅参照框架;测试任务、通过阈值和复测机制必须由合同附件补齐。2026 年发布的人形机器人与具身智能标准体系覆盖基础、部组件、整机、应用和安全伦理等多个层次,也说明一份基准测试方法不能替代整个生命周期标准体系。
这份标准实际管什么
公开标准范围指向单个具身智能系统,测试对象不是只看语言模型,也不是只看机械本体,而是观察系统能否在给定环境和任务下完成从感知、决策到动作执行的闭环。它同时覆盖仿真和真实环境,适合研发团队建立可重复基线,也可以为采购方设计验收方案提供共同语言。
框架可拆成四部分。第一是测试环境设置,需要记录场景、对象、干扰、边界和安全条件;第二是测试任务库,用于定义目标、起始状态、成功条件和失败条件;第三是测试过程,规定如何启动、重复、记录和处理异常;第四是指标计算,把每次任务记录转换为可复核结果。公开信息并不能支持原稿所称“配套上线超过一万条任务、覆盖 300 种类型”,因此本次改写删除这些数字。
测试资料、任务版本和结论需要长期复用时,可参考站内已复核的AI 知识管理与 RAG 验收指南建立版本、来源和失效机制;测试涉及现场数据、人员影像或业务系统时,再用企业 AI 数据合规清单核对数据清单、权限、保留和事件响应。这些内容用于补充资料治理,不替代标准原文。
采购方怎样把标准变成验收表
采购文件只写“符合 YD/T 6770—2026”仍然太宽。可执行的验收条款至少要补齐测试对象、任务版本、环境边界、成功条件、重复规则和原始记录。尤其是会移动、抓取或与人协作的系统,安全停止条件应先于成绩计算。以下字段可以作为验收记录的最小骨架:
- 对象身份:整机、本体、模型、控制器、传感器和工具的型号、固件、权重或软件版本;任何影响行为的更新都要重新留档。
- 环境快照:仿真器版本、随机种子、场地尺寸、光照、网络、对象摆放、人员活动范围与允许的外部提示。
- 任务定义:初始状态、目标状态、时间或资源限制、成功条件、失败条件以及不得触碰的安全边界。
- 干预规则:哪些提示属于正常输入,哪些属于人工接管;接管、复位、重试和远程协助都应单独计数。
- 重复与抽样:同一任务执行多少次、是否随机化、异常样本是否保留,以及区间和离散程度如何报告。
- 证据包:原始日志、视频、传感器摘要、错误码、开始结束时间、能耗或资源记录,以及复核者签名。
如果测试结果会进入采购决策或企业系统,应把原始记录、异常筛选、复核签字和结论边界纳入AI 审计证据清单;涉及智能体身份、工具权限、监控与退役时,再对照企业 AI 智能体治理指南。这些内部资料用于补充工程步骤,最终合同口径仍应引用合法取得的标准文本和双方确认的测试附件。


如何保证两次测试真的可比
基准测试最容易被忽略的不是公式,而是“比较条件漂移”。系统更新一次模型、相机固件、运动控制器或工具权限,结果就可能变化;测试场地换了照明、网络、物体批次或人员站位,也可能让同一任务的难度改变。采购附件应明确一个可复现基线,并对每一项变更登记负责人、时间、原因、影响判断和复测范围。
建议把测试协议本身也做版本管理。协议应锁定任务定义、任务分层、随机种子生成方式、重复次数、计时起止、超时上限、异常样本处理、人工提示和接管的记录规则。看见结果后再改变分母、删除失败或延长超时,会让测试从“验证预先约定的能力”退化为“挑选最好看的数字”。需要把评估从问题定义一路连接到上线监控时,可以参考站内AI 项目从问题定义到评估与监控的完整方法;它补充的是工程闭环,不改变本标准的法定范围。
| 变更对象 | 典型例子 | 最低动作 | 通常应触发完整复测的情形 |
|---|---|---|---|
| 模型与策略 | 权重、系统提示、规划器、记忆或检索源 | 登记版本与哈希,运行受影响任务和固定回归集 | 目标选择、动作序列或安全决策逻辑变化 |
| 本体与控制 | 电机、夹具、控制器、固件、标定参数 | 重新标定并复核精度、力限与停止功能 | 动作边界、速度、载荷或安全停止能力变化 |
| 感知系统 | 相机、雷达、传感器位置、识别模型 | 保留前后配置,复测覆盖、遮挡和扰动任务 | 输入模态、视场、采样频率或故障降级路径变化 |
| 工具与权限 | 新增 API、远程操作、写入权限、自动恢复 | 更新权限清单、审批点和审计日志 | 系统获得新的现实世界动作或高影响写入能力 |
| 环境与任务 | 场地、照明、网络、对象、人员、任务难度 | 记录环境快照并说明与旧基线的差异 | 成功条件、失败代价或目标人群发生变化 |

固定回归集不是永远不变的“题库答案”。它要保留一组跨版本可比的核心任务,同时另设盲测或轮换任务,减少团队针对已知样本调参。每次复测应输出逐次记录和差异说明:哪些任务改善、哪些退化、退化是否集中在某类场景、人工接管是否增加、安全停止是否正常。只有影响判断、原始证据和批准人都可追溯,新版本才可以替换旧基线;否则应限制上线范围或回滚,并把决定、责任人与恢复条件写进验收记录。
指标不能脱离分母和测试条件
公开解读资料提到任务执行效率、任务成功率、人工干预、场景扰动和任务能耗等观察维度。阅读任何评测报告时,都不能只抄一个百分比:成功率要说明任务集合和重复次数;执行效率要说明时间从何时开始、失败样本如何处理;人工干预要定义提示、接管和复位;扰动要写明强度与出现位置;能耗则要说明测量边界,是本体、计算单元还是整个测试场地。
两个厂商即使都报告“成功率 90%”,只要任务难度、物体摆放、网络条件、人工提示或失败重试不同,就不构成直接可比。采购方应要求同时提供分子、分母、置信区间或至少逐次结果,而不是只接收汇总图。对于公平、隐私、安全、问责和人工监督等上线条件,可结合AI 道德准则工程落地模板逐项转换为责任人和可验证控制,避免系统为了通过演示而获得不必要的高权限。
| 指标 | 必须同时报告 | 常见误导 | 建议复核 |
|---|---|---|---|
| 任务成功率 | 成功次数、总次数、任务分层、重复规则 | 只给百分比,隐藏简单任务占比 | 逐任务结果与区间 |
| 执行效率 | 计时起止、失败/超时处理、硬件资源 | 只统计成功样本或排除等待时间 | 原始时间戳与全样本分布 |
| 人工干预 | 提示、接管、复位、远程协助的定义与次数 | 把人工提示算作自主完成 | 视频、操作日志和权限记录 |
| 扰动鲁棒性 | 扰动类型、强度、出现时机和随机种子 | 不同强度结果直接横比 | 固定扰动集与盲测 |
| 能耗 | 测量边界、设备、时间窗和环境条件 | 本体能耗与整套系统能耗混用 | 计量设备记录与重复测量 |
这类“指标—任务—证据—上下文”绑定也符合通用 AI 测试方法。NIST 的 AI 测试、评价、验证与确认(TEVV)页面强调,准确性、鲁棒性、安全和透明度需要不同测量组合,而且系统所处情境会改变评价方式。它不是 YD/T 6770 的解释机构,引用它只是说明:任何 AI 基准都不应脱离预定用途和真实运行环境。
标准能证明什么,不能证明什么
- 能支持:用共同术语设计测试;在记录条件一致时比较同一系统版本;发现感知、决策、执行或恢复环节的薄弱点;为合同附件和研发回归测试提供结构。
- 不能自动证明:某厂商“行业第一”、某产品适合所有场景、系统长期运行可靠、数据与网络安全合规,或采购后一定产生投资回报。
- 不能替代:功能安全、网络安全、隐私、机械与电气安全、行业场景规范,以及采购双方约定的特殊工况测试。
因此,标准实施也不会自动触发所谓“首轮国考成绩单”。是否由某个机构开展检测、采用哪些任务、报告能否公开、是否具有认证或招标效力,都需要单独查证,并记录核验日期。不要依据一篇新闻稿推断某家公司将获得订单、估值提升或融资优势。
一套可复核的测试流程
- 从业务风险反推任务,先选真实高频且失败代价可控的场景,不用只为展示效果设计任务。
- 冻结系统和环境版本,保存配置哈希、模型版本、工具权限与数据快照。
- 把成功、失败、超时、人工接管和安全停止写成机器可记录的事件。
- 先在仿真环境做边界与破坏性测试,再在受控真实环境复核迁移差异。
- 按预先约定的次数执行,保留失败样本,不在看到结果后临时排除“不好看”的任务。
- 由非开发人员抽查证据包,复现至少一部分结果;每次版本更新运行固定回归集。
如果项目还处在方案阶段,应先冻结目标、系统边界、工具权限和人工审批,再决定哪些能力需要用具身系统验证。基准测试解决的是“在规定条件下表现如何”,而生产上线还要回答“出错时谁接管、如何停止、日志能否审计、版本能否回滚”。
采购附件应至少交付哪些证据
| 证据包 | 最低内容 | 验收用途 | 保留要求 |
|---|---|---|---|
| 配置清单 | 整机、传感器、模型、固件、工具与哈希 | 确认测试对象未被替换 | 随版本冻结 |
| 任务清单 | 初始/目标状态、成功失败、超时和安全停止 | 固定分母与难度 | 变更需双方签字 |
| 环境记录 | 场地、光照、网络、摆放、人员、随机种子 | 解释仿真与真实差异 | 照片/视频与结构化字段并存 |
| 逐次结果 | 时间戳、状态、干预、错误码、能耗和日志 | 复算汇总指标 | 不能只留汇总图 |
| 异常与复测 | 排除理由、修复版本、复测范围和审批人 | 防止结果后删样本 | 保留原失败记录 |
| 上线差距 | 未覆盖风险、安全测试、运维与回滚责任 | 避免把基准通过当生产批准 | 作为上线门禁输入 |
工信部与国务院国资委 2026 年的人形机器人与具身智能实景实训专项行动强调真实生产生活环境中的部署应用。实景实训不等于放松测试,相反更需要先约定人员隔离、紧急停止、人工接管和事件报告。市场监管总局等部门的标准制定与实施监督指导意见也要求规范推荐性标准的组织实施和企业声明,采购方不应把“符合标准”当成没有对象、版本和报告范围的营销标签。
测试报告、认证证书和采购验收不是一回事
测试报告记录某个对象在约定方法和条件下得到的结果;认证通常还涉及明确的认证规则、实施机构、监督或持续符合性;采购验收则依据合同判断本次交付是否通过。YD/T 6770—2026 是方法标准,公开页面本身没有授予任何机构“官方排行”或通用认证资格。供应商提交报告时,采购方应核对出具机构、委托方、样品身份、版本、测试范围、使用的标准条款、报告日期和任何分包项目,不能只看封面上的“通过”二字。
若合同要求第三方检测,还要提前约定实验室能力范围、见证方式、样品封存、软件更新后的复测触发条件,以及报告只对送检样品负责还是覆盖量产批次。对于会持续更新模型或策略的系统,版本变化可能使旧报告失去代表性;至少应建立变更分级,说明哪些修订只做回归测试,哪些必须重新执行完整任务集。
失败以后怎样定位,而不是只要求“再跑一次”
具身智能任务是感知、状态估计、规划、控制和机械执行的串联系统。一次失败可能来自对象没被看见、世界状态判断错误、计划不可执行、动作控制超限、工具调用失败,也可能只是测试环境没有按协议初始化。若没有分层事件和时间戳,团队只能反复重跑,既无法判断产品缺陷,也无法证明复测是否修复了同一个问题。
| 失败层 | 应保存的证据 | 复核问题 | 复测门禁 |
|---|---|---|---|
| 任务与环境 | 任务版本、初始状态、对象摆放、随机种子、环境快照 | 测试是否按同一协议启动;难度是否发生漂移 | 先恢复可比条件,再讨论系统成绩 |
| 感知与状态估计 | 传感器时间戳、输入摘要、目标/姿态结果、置信信息 | 是输入缺失、标定异常,还是识别错误 | 覆盖原失败条件和相邻扰动条件 |
| 决策与规划 | 目标、约束、候选计划、拒绝或降级理由 | 系统是否理解目标与禁止事项;计划是否物理可行 | 不能只验证原轨迹,还要检查同类任务 |
| 控制与执行 | 控制命令、反馈、力/速度限制、错误码、急停记录 | 计划正确但执行偏差,还是安全控制主动阻断 | 安全停止失败必须进入高优先级完整复测 |
| 人工与工具 | 提示、接管、复位、远程操作、API 调用和权限日志 | “成功”是否依赖未声明的人工或外部工具 | 接管与重试必须计入分母,不得覆盖原失败 |
| 结论与审批 | 根因假设、修复差异、回归范围、遗留风险、签字 | 证据是否足以支持根因,而非只与成功相关 | 无法解释的退化不得批准为新基线 |
“安全停止”与“任务成功”必须分开记分:系统因检测到人员进入危险区而停止,任务结果可以是未完成,但安全控制可能正确;反过来,系统勉强完成任务却越过力限、碰撞边界或依赖隐蔽接管,不能算作合格成功。对故障证据做版本、来源、完整性和复核人管理,可继续使用站内AI 性能数据可复现证据指南建立原始记录与汇总结论之间的链路。
这也是为什么测试通过不能替代上线治理。NIST AI 风险管理框架把治理、情境映射、测量和风险管理视为持续活动;本文引用它仅用于说明生产环境中的风险闭环,并不把它当作 YD/T 6770—2026 的条文解释。采购方仍需依据自身场景的人员安全、网络安全、数据保护、事件响应和停机恢复要求设置额外门禁。
官方资料与复核说明
标准编号、状态、备案号、发布日期、实施日期和范围以全国行业标准信息服务平台的 YD/T 6770—2026 详情页为主,并可在国家标准信息公共服务平台的行业标准页面交叉核对。关于行业标准定位的政府公开解读见福州市政府转载的标准解读;具身智能真实世界训练的政策背景可参考工信部、国务院国资委 2026 年行动方案公开页;国家标准计划与已发布标准的区别,可对照具身智能相关国家标准计划页面。本文删除了旧来源链中与现行 6770 标准发布事实无直接证明关系的“2026 年第三批行业标准制修订计划”,避免读者把计划项目当成现行标准的发布依据。
资料复核日期:2026 年 7 月 18 日。标准全文可能受版权和获取渠道限制,本文只做公开信息解读,不替代正式标准文本、检测报告、认证结论或采购合同。实施测试前,应取得合法版本并由测试、法务、安全和业务负责人共同确认适用条款。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。原稿将行业标准误称为国家标准,并写入“万级任务库、300 种任务、资本市场赢家、首轮国考”等缺少一手证据的结论;本版删除全部无法复核的数字、投资推断及无直接证明关系的制修订计划引用,依据官方标准页面与《行业标准管理办法》重建文件层级、推荐性效力、采购字段、指标分母、证据包和“标准—合同—生产”三层边界。本文没有进行厂商横向实测,也不据此推荐具体机器人或股票。本站更新与纠错原则见关于本站与编辑规范。
