AI应用与工作流

Labelbox 是什么?数据标注、RLHF、模型评估、LBU 成本与安全指南

Labelbox已从传统标注工具扩展为多模态训练数据与模型评估平台。本文说明Annotate、Catalog、Foundry、质量流程、LBU计费、数据存储和14天试点方法。

Labelbox 从任务契约、数据连接、本体、标注、审核、导出到模型评估和错误切片回流的数据工厂闭环
本页目录
  1. Labelbox 现在是什么?先分清平台、模型能力和人工服务
  2. Catalog、Ontology、Project、Workflow 和 Model Run 分别做什么?
  3. 怎样用 8 步做一个可验收的 Labelbox 试点?
  4. Benchmark、Consensus 和审核能保证标签正确吗?
  5. Labelbox 如何用于 SFT、偏好排序、RLHF 和模型评估?
  6. Labelbox 多少钱?LBU 应该怎样计算?
  7. 数据放在哪里?中国团队采购前必须核对哪些边界?
  8. 什么时候适合 Labelbox,什么时候不适合?
  9. 14 天试点怎样判断继续、缩小还是停止?
  10. 常见问题
  11. Labelbox 能自动保证数据质量吗?
  12. Labelbox 免费层适合生产吗?
  13. 使用 Foundry 就不需要人工标注了吗?
  14. Consensus 越高越好吗?
  15. Labelbox 和 MTurk 是同一种产品吗?
  16. 编辑复核与纠错记录

先给答案:Labelbox 已不只是“给图片画框”的数据标注工具。按其当前官方产品结构,它把多模态数据管理、人工标注、模型预标注、审核返工、生成式 AI 后训练数据和模型评估放进同一套平台,并另售专家标注与评测服务。是否值得用,不取决于功能列表有多长,而取决于你的任务能否写成明确 rubric、质量能否复核、数据能否合规连接、LBU 与附加费用能否算清,以及结果能否顺利导出。

Labelbox 从任务契约、数据连接、本体、标注、审核、导出到模型评估和错误切片回流的数据工厂闭环
Labelbox 可以承载闭环,但“什么算正确、何时停止、谁批准上线”仍必须由使用团队定义。图:兰塞 AI 编辑部原创。

本文面向准备做计算机视觉、文本、音频、对话、多模态评估、SFT、偏好排序或 RLHF 数据项目的中文团队。资料依据 Labelbox 官方文档和定价页整理,复核日期为 2026 年 7 月 16 日。旧稿中“领先、易用、确保质量、强大助力”等没有可验证条件的评价已删除;本文不代表本站实际采购或替 Labelbox 背书。

Labelbox 现在是什么?先分清平台、模型能力和人工服务

Labelbox数据标注与RLHF集成工作流
Labelbox 从数据接入到标注到RLHF输出的完整工作流

Labelbox 的当前平台概览把它描述为生成式 AI 的数据工厂,并列出 RLHF、SFT、多模态 LLM 评估、偏好排序、聊天竞技场、红队、文本到图像/视频/音频以及代码和智能体任务。这里至少包含三层,不应混成一个“自动标注平台”。

主要作用 不会自动替你完成什么
软件平台 Catalog、Annotate、Workflow、Model evaluation、团队与权限管理 不会自动定义业务真值、数据权利或上线标准
模型辅助 Foundry、模型预测、pre-label、AI critic 等辅助生成或检查候选 不会保证候选正确,也不会消除人工复核
人工服务 使用标准标注人员或 Alignerr 专家完成数据生成和评测 不会替采购方承担数据合法性、任务定义和最终模型责任

Annotate 官方说明列出的媒体类型包括图像、视频、文本、文档、地理空间、音频、对话文本、HTML、LLM 人类偏好、提示与回答生成以及多模态聊天评估。平台支持内部团队、自有供应商或 Labelbox 服务人员;选择哪种人力来源是运营决策,不是产品名称本身决定的。

Catalog、Ontology、Project、Workflow 和 Model Run 分别做什么?

对象 它回答的问题 项目负责人必须留下的证据
Catalog / Dataset 有哪些数据、来自哪里、怎样筛选和组成批次 来源、版本、权限、切片、删除与导出路径
Ontology 需要标什么对象、分类或关系 schema 版本、定义、正反例、变更影响
Instructions 标注人员遇到边界和歧义时怎么判断 rubric、例外、无法判断选项、升级路径
Project 哪批数据使用哪个 editor、ontology 和质量流程 负责人、批次、角色、期限、验收与导出版本
Workflow 数据行如何从标注进入审核、返工和完成 路由条件、抽检比例、拒绝原因和审计日志
Experiment / Model Run 某次模型版本在预测、指标和数据切片上表现怎样 模型/数据/标签版本、预测、指标、错误切片和后续动作

Ontology 文档把本体拆为对象、分类和关系。改变本体不是普通排版修改:新增、删除或调整 schema 可能让旧标签失去一致解释,因此正式项目应冻结版本,并先决定旧标签是迁移、重标还是保留在旧版本。

标注说明文档强调 instructions 与 ontology 关联,更新后会影响使用该本体的项目。说明里最重要的不是写很多字,而是让标注者知道“何时不要猜”:证据不足、对象遮挡、类别冲突或任务超出范围时,应该跳过、标记不确定或升级给专家。

怎样用 8 步做一个可验收的 Labelbox 试点?

  1. 写任务契约:明确数据单位、允许的输入、输出 schema、禁止事项、成功标准和最终责任人。例如“识别客服对话中的退款意图”仍不够,还要定义多意图、反讽、信息不足和敏感信息如何处理。
  2. 决定数据连接:先选 IAM、预签名 URL 或直接上传,再导入少量代表数据。数据位置、访问期限和删除流程没有批准前,不导入生产敏感数据。
  3. 建立 ontology 与 instructions:为每个标签写定义、正例、反例、边界例和“无法判断”。用 30–100 个覆盖常见与高风险切片的样本演练。
  4. 双人试标:让至少两名合格人员独立完成同一小批,不先互相讨论;记录分歧来自定义、说明、数据质量还是人员理解。
  5. 配置审核与返工:高风险切片全审,低风险切片按可解释规则抽样;拒绝时必须选择原因,返工后保留前后标签和责任轨迹。
  6. 建立质量证据:使用经过专家裁决的 benchmark 检查关键样本,用 consensus 观察人员之间的一致性,同时保留争议率和裁决结果。
  7. 小范围使用预标注:只在已知类别和代表样本上启用模型候选,分别记录接受、修改、拒绝和漏标;不要只统计“节省点击次数”。
  8. 导出并闭环:把 ontology、标签、数据 ID、批准状态和版本一起导出;训练或评估后,把高影响错误切片送回 Catalog、重标或补采,而不是继续扩大低质量批次。

Workflow 文档的默认路径是 initial labeling、initial review、rework 和 done,也允许按标注者、标签、时间、consensus、数据集、元数据、模型预测和抽样概率等条件路由。每个数据行还会形成审计日志。这些机制能回答“发生了什么”,但前提是团队没有用随意的筛选条件和无理由的审批把流程变成形式。

Benchmark、Consensus 和审核能保证标签正确吗?

不能。三者提供不同证据,不能互相替代。Labelbox 的质量分析文档提供 benchmark 与 consensus 等工具,但平台分数仍依赖任务定义、比较方法和参考标签质量。

方法 能发现什么 不能证明什么 正确用法
Benchmark 标注者与一组参考标签的偏差 参考标签本身一定客观正确 由有资格人员裁决,覆盖关键切片并定期复查
Consensus 多名标注者之间的一致程度 多数意见等于事实;低一致一定是人员差 把分歧拆成 rubric、数据、专业知识和主观差异
Review / Rework 批准、拒绝、修正和责任轨迹 审得越多质量就线性提高 按风险分层,记录拒绝原因与复发模式
模型预标注 已知任务上的候选标签和难例 模型置信度等于标签可靠度 按切片测接受、修改、拒绝和漏标,保留人工退出

研究论文 The “Problem” of Human Label Variation提醒:人类标签差异有时来自合理的观点、背景和任务歧义,不应一律当作噪声消除。情绪、伤害性、相关性、偏好和对话质量等任务尤其需要把争议分布保留下来;强行压成单一标签可能让数据看起来整齐,却掩盖真实边界。

Labelbox 如何用于 SFT、偏好排序、RLHF 和模型评估?

生成式 AI 项目的核心不是把传统图片标注换成聊天界面,而是把评价 rubric 写成可执行判断。例如一条回答的事实忠实度、指令遵循、安全性、完整性和表达质量应分别定义;如果只问“哪个回答更好”,偏好数据会混入未说明的个人标准。

任务 数据单位 最低 rubric 主要风险
SFT 输入—理想输出或多轮对话 任务完成、事实来源、格式、安全和拒答边界 把风格偏好当事实;复制受限内容;模板过度重复
偏好排序 同一输入的两个或多个候选回答 比较维度、平局/都差、证据不足和裁决规则 位置偏差、长度偏差、品牌偏好和主观多数压制
RLHF / 后训练 偏好、评分、批评或修订轨迹 标注者资格、任务版本、质量抽检和数据权利 奖励错误代理指标,导致模型迎合而非正确
多模态评估 文本、图像、音频或视频与模型输出 模态一致、可见证据、时间片和无法判断条件 遗漏不可见信息、音画错位和敏感内容暴露
红队 攻击提示、响应、风险分类和处置 授权范围、人员保护、严重度和升级路径 把危险内容扩散给无授权人员或缺少心理支持

Model evaluation 文档把流程组织为 experiment 与 model run:上传预测、分析性能、识别高影响数据、送回重标或相似数据检索,再创建新 run 迭代。它适合保存比较轨迹,但“模型改进”仍要在独立冻结评测集和真实业务切片上证明,不能用同一批被反复挑选的数据既训练又宣称提升。

如果团队还没有稳定的数据来源、版本和权限治理,可先参考站内的AI 知识管理与数据治理指南;如果任务涉及不同云端与本地边界,可结合本地 AI 与云端 AI 的隐私、成本和运维比较制定连接策略。

Labelbox 多少钱?LBU 应该怎样计算?

Labelbox 当前LBU 计费文档把 LBU 定义为标准化数据消耗单位。它不是美元价格,也不是全部成本。Catalog 按月消耗,Annotate 和 Model 主要按数据行一次性消耗;不同数据类型还有页数、帧数或任务类型差异。

Labelbox 成本由 Catalog 月度 LBU、Annotate 一次性 LBU、Model 一次性 LBU、订阅、Foundry 推理、专家服务和内部复核共同组成
先拆开产品消耗,再计算总拥有成本;免费额度不等于生产项目免费。图:兰塞 AI 编辑部原创。
资产类型 Catalog(月度) Annotate(一次性) Model(一次性)
图像、文本、聊天/离线多模态、音频 1 LBU / 60 行 1 LBU / 行 1 LBU / 5 行
PDF 1 / 60 行 + 1 / 60 页 1 / 页 1 / 5 页
视频 1 / 60 行 + 1 / 5000 帧 1 / 行 + 1 / 150 帧 1 / 5 行 + 1 / 1500 帧
地理空间与医学切片影像 1 / 6 行 4 / 行 1 / 行
Live Multimodal/LLM 1 / 60 行 20 / 行 1 / 5 行

例如,1000 张图像全部进入 Catalog、全部完成 Annotate,其中 500 张先使用 Model/Foundry 生成预测,按文档表格可先估算:Catalog 为 1000÷60 LBU/月,Annotate 为 1000 LBU 一次性,Model 为 500÷5=100 LBU 一次性。实际账单还要确认平台如何处理小数或取整,并叠加软件订阅、Foundry 推理、专家服务和团队人工复核。

  • 免费账户当前每月有 500 LBU;达到额度后仍可访问和导出数据,但在下个计费周期前不能继续新增数据行、标签或预测,除非升级。
  • Catalog 有 7 天宽限期,但宽限期内一旦给数据行添加标签,该行仍会产生 Catalog 消耗。
  • Annotate 中 skipped 数据行也被视作已标注并计入 LBU。
  • Foundry 可能根据模型、数据量和任务复杂度产生额外推理费用。

当前官方账户方案文档区分 Free、Starter 与 Enterprise:Starter 可在 Billing 中升级,Enterprise 需要联系销售定制。公开文档没有提供一个适用于所有企业项目的固定总价。采购前应在自己的账户和书面报价中核对 LBU 单价、订阅或最低承诺、推理、专家服务、支持、超额、存储、合同期限和退出成本;不要引用搜索缓存或已经跳转失效的旧费用计算器数字。

数据放在哪里?中国团队采购前必须核对哪些边界?

Access、storage & security 文档列出三种资产连接方式:使用 IAM 委托访问自己的 AWS S3、Google Cloud Storage 或 Azure Blob Storage;使用预签名 URL;直接上传到 Labelbox 的私有 Google Cloud bucket。官方把 IAM 委托访问列为推荐方式。

方式 资产主要位置 优势 采购前检查
IAM 委托访问 客户自己的云存储 可使用原生角色、权限和生命周期 最小权限、跨账号信任、撤销、日志、区域和出网
预签名 URL 客户自己的存储 不用把长期云密钥交给平台 有效期、刷新、泄露范围、缓存和访问日志
直接上传 Labelbox 的私有 GCS bucket 试用简单 美国存储、删除证明、导出、合同与敏感数据限制

该官方页面明确写明:Labelbox 使用 Google Cloud,托管在其服务器的数据存储在美国,不在欧盟存储,也不会按请求改为欧盟存储;官方同时声称托管数据静态使用 AES-256 加密,并提供 MFA、企业 SSO、数据导出和删除请求能力。这里应理解为供应商公开声明,不是本站完成了独立安全审计。

中国团队还要根据数据类型、主体、跨境、行业和合同要求完成自己的安全、隐私和法律评估。不要把“平台声称符合某标准”直接等同于你的具体项目合规。至少要求数据流图、分包商清单、DPA、保留期限、删除 SLA、事故通知、渗透/审计证据、模型训练使用条款、人员访问地域和导出格式。

什么时候适合 Labelbox,什么时候不适合?

场景 优先路线 理由
多模态、多团队、需要复杂审核返工和模型误差闭环 认真试点 Labelbox 平台对象和质量流程较完整,减少自建编排工作
只有一次性小批简单分类,预算极低 先比较轻量或开源工具 平台治理和订阅成本可能超过任务本身
数据不能离开内网,且无法接受外部 SaaS 元数据 优先评估自托管 必须先满足部署和数据边界,而不是迁就工具
没有内部项目负责人,希望供应商交付完整结果 比较全托管服务并保留验收责任 购买软件不会自动获得人员、rubric 和项目管理
需要大量通用众包人员完成简单任务 比较专业服务与众包市场 人力来源、资格、费用和隐私边界不同
尚未定义任务和评测集 暂缓采购 任何平台都无法替代可标注任务和可验收标准

若要比较开放众包市场,可先阅读站内的MTurk Requester、Worker、费用与质量指南;若要比较 AI 平台,不要靠一场演示决定,可使用统一真实任务与冻结样本的评测方法。如果后续还要把标注、检索、模型和工具调用接进应用,站内的LangChain 架构与生产边界说明可帮助区分数据生产平台与应用编排框架。

14 天试点怎样判断继续、缩小还是停止?

  1. 第 1–2 天:冻结 100–500 条代表样本、任务版本和风险切片;完成数据连接与权限检查。
  2. 第 3–4 天:两名标注者独立试标,修正 ontology 与 instructions;不追求产量。
  3. 第 5–7 天:配置 review/rework、benchmark 和 consensus;记录争议、修改与审核时间。
  4. 第 8–10 天:在一半样本上启用 pre-label,另一半保持纯人工,比较每条合格标签的总时间和错误。
  5. 第 11–12 天:导出标签和版本,跑一次模型或离线评估;确认数据能被下游真实使用。
  6. 第 13–14 天:复算 LBU、推理、服务和内部工时;评估权限、日志、导出和删除;决定扩量、整改或退出。
指标组 建议记录 停止线示例
任务 无法判断率、schema 变更、争议原因 关键类别无法形成稳定定义
质量 benchmark 偏差、consensus、审核修改率、严重错误 高风险错误无法通过流程稳定发现
效率 标注、审核、返工、等待和管理时间 预标注增加返工,合格标签总时间不降反升
成本 LBU、订阅、推理、服务和内部人员 单位合格标签成本超预算且没有可解释收益
数据 访问、地域、日志、导出、删除和供应商人员 不能满足数据位置、合同或最小权限要求
模型 冻结集、关键切片、错误类型和业务结果 标签数量增长但独立评测没有改善

常见问题

Labelbox 能自动保证数据质量吗?

不能。它提供工作流、benchmark、consensus、审核、返工、模型辅助和审计工具;质量仍取决于任务定义、参考标签、人员资格、抽样、裁决和独立模型评测。

Labelbox 免费层适合生产吗?

适合做小规模可行性测试,但当前每月 500 LBU 的额度和达到上限后的新增限制意味着它不能被默认当作大规模生产预算。还要检查免费层的团队、权限、支持和安全能力是否符合项目要求。

使用 Foundry 就不需要人工标注了吗?

不需要从零标每一项,不等于不需要人。预标注应作为候选,并用代表样本比较接受、修改、拒绝、漏标、时间和严重错误;高风险任务必须保留人工裁决和停止条件。

Consensus 越高越好吗?

不一定。高一致可能来自清晰任务,也可能来自标注者共同误解;低一致可能暴露说明不清、数据不足或合理观点差异。应查看分歧发生在哪些切片以及专家如何裁决。

Labelbox 和 MTurk 是同一种产品吗?

不是。Labelbox 是数据与模型工作流平台并可附加专家服务;MTurk 是 Requester 与 Worker 交易 HIT 的开放众包市场。两者在人力来源、项目管理、质量工具、费用和数据责任上不同。

编辑复核与纠错记录

本文由兰塞 AI 编辑流程于 2026 年 7 月 16 日复核。旧稿把 Labelbox 简化为传统数据标注平台,并使用“领先、易用、强大、确保质量”等无法脱离任务验证的评价;新版依据当前官方平台、Annotate、Ontology、Workflow、质量分析、模型评估、LBU、定价和数据安全文档,重建为任务契约、质量证据、成本复算、数据边界和 14 天试点框架。本站的来源、更新与纠错原则见关于本站与编辑规范