AI应用与工作流

CrowdFlower、Figure Eight 与 Appen 是什么关系?ADAP 数据标注与模型评估指南

CrowdFlower已更名为FigureEight,并于2019年被Appen收购。本文解释旧品牌与当前ADAP的关系,覆盖数据标注、LLM/Agent评估、质量控制、安全合规、供应商选型及30天试点验收。

Appen项目从任务定义样本分层标注校准复核到模型评估审计与返工的质量闭环图
本页目录
  1. CrowdFlower、Figure Eight 与 Appen 到底是什么关系
  2. Appen 现在提供什么:平台、数据与服务要拆开看
  3. 哪些数据和任务适合放入标注平台
  4. 生成式 AI 和智能体需要的不是普通“打标签”
  5. AI 预标注能提速,但不能自己证明正确
  6. 质量体系的核心:标签本体、说明书与金标
  7. 一致性不是准确率:必须按切片报告错误
  8. 数据采集先问权利和同意,再问数量
  9. 安全与合规:证书是入口,不是项目结论
  10. 自建、Appen 与其他平台怎么选
  11. 成本不能只看每条标签价格
  12. 模型评估项目要把“标签质量”连接到产品风险
  13. 30 天试点怎么设计
  14. 合同、SLA 与退出条款要写到可执行
  15. 常见问题
  16. CrowdFlower 或 Figure Eight 现在还能单独注册吗?
  17. Appen 是软件平台还是外包公司?
  18. 平台能自动保证标注质量吗?
  19. AI 预标注会不会替代人工?
  20. 小团队是否适合 Appen?
  21. 最终选型清单

一句话答案:CrowdFlower 在 2018 年更名为 Figure Eight,Appen 于 2019 年宣布并完成收购;今天搜索这两个旧品牌,真正需要评估的是 Appen 当前的 AI Data Platform(ADAP)、数据采集与标注服务、贡献者体系以及面向大模型和智能体的训练与评估能力。它不是“上传数据就自动得到高质量标签”的魔法工具,也不应只按每条标签价格选型。可靠项目必须同时定义数据权利、标签本体、人员资格、质量抽检、安全边界、模型评估、返工和退出方式。

编辑更正(2026-07-18):旧稿把 CrowdFlower、Figure Eight 和 Appen 当成三个可并列选择的平台,并使用“准确率高、节省成本、适合所有规模”等无基线结论。新版依据当前 Appen 产品页、帮助中心与历史公告,纠正品牌关系,撤回无证据性能承诺,并加入 LLM/Agent 数据、AI 预标注、分层质量、安全合规、单位经济性和 30 天试点框架。Appen 官网披露的规模与合规信息均按厂商自述处理,不代表本站独立审计。
Appen项目从任务定义样本分层标注校准复核到模型评估审计与返工的质量闭环图
数据平台只能承载流程,不能替代任务定义和质量责任。真正可交付的是一条能复现、能审计、能发现错误并回流修订的证据链。图:兰塞 AI 编辑部原创。

CrowdFlower、Figure Eight 与 Appen 到底是什么关系

2018 年更名公告显示,CrowdFlower 当时将公司名称改为 Figure Eight;Appen 2019 年收购公告又明确写明 Figure Eight 以前名为 CrowdFlower,并计划把平台与 Appen 的全球数据能力结合。因而旧教程里的 CrowdFlower 控制台、Figure Eight 注册入口、套餐和按钮路径均不能直接套用到今天。

名称 应如何理解 今天该做什么
CrowdFlower 2007 年创立的历史品牌,后来更名 只用于理解旧资料、旧 API 或历史案例
Figure Eight 2018 年后的品牌名,2019 年被 Appen 收购 遇到旧域名和旧教程时回查 Appen 当前文档
Appen ADAP 当前 Appen AI Data Platform 的产品名称 按当前租户、合同、地区和功能开关逐项核验
Appen 服务 平台之外的数据采集、人员、项目和专家服务 区分软件能力、人员服务和客户自己的责任
CrowdFlower在2018年更名Figure Eight并于2019年被Appen收购而当前产品为Appen ADAP的时间线
这条时间线解决的是品牌继承关系,不代表所有历史功能都被原样保留。具体能力仍应以当前合同、帮助中心和实际租户为准。图:兰塞 AI 编辑部原创。

Appen 现在提供什么:平台、数据与服务要拆开看

Appen ADAP 产品页把当前平台描述为自动化与人工监督结合的标注环境,覆盖文本、图像、音频、视频、地理空间等数据,并提供任务配置、工作流、质量控制、人员管理和 API 集成。AI 训练数据总览还列出模型对齐、智能体轨迹、多模态、物理 AI 和模型评估等数据服务。这里必须区分“软件中存在某个能力”与“你的账户、项目和地区已包含该能力”。

主要对象 客户仍需负责
平台层 任务设计、标注界面、路由、复核、分析与导出 本体、说明书、权限、集成、版本和验收
数据层 客户数据、定制采集、现成数据集与衍生标签 来源、许可、同意、用途限制、保留与删除
人员层 内部专家、供应商团队或全球贡献者 资格要求、培训、冲突、薪酬与升级路径
服务层 项目管理、质量运营、专家审核和咨询 交付边界、责任人、SLA、变更与退出

Appen 平台概览说明,实际界面会随团队启用的功能而变化,Quality Flow 可用于持续或抽样质检、向贡献者反馈、调查个人质量和在项目内串联多步操作。这恰好说明截图教程很容易过时;本文更关注职责、证据和验收,而不是写死按钮位置。

哪些数据和任务适合放入标注平台

Appen 数据标注服务页列出的任务包含文本意图、实体、情感与相关性,图像框选、分割与关键点,语音转写、说话人分离,以及视频动作识别。与本站的自然语言处理任务地图计算机视觉项目方法结合看,选工具前应先确认模型需要的学习信号,而不是先选一个界面再寻找用途。

数据模态 典型任务 最容易漏掉的验收项
文本 分类、实体、关系、相关性、偏好与安全 上下文、语言变体、歧义和不可判定标签
图像 分类、框、分割、关键点、OCR 遮挡、小目标、边界规则和空样本
音频 转写、说话人、事件、情感和口音 重叠语音、噪声、时间戳和隐私信息
视频/3D 跟踪、动作、时序分割、点云与传感器融合 跨帧一致性、坐标系、插值和长序列上下文
LLM/Agent 示范、偏好、红队、轨迹、验证器和 RAG 评估 工具副作用、事实来源、失败严重度和可复现环境

数据量大不等于适合众包。受限医疗影像、未脱敏日志、商业机密、儿童数据、精确位置或高风险决策记录,可能需要封闭环境、具备资质的专家、地区隔离甚至完全不外发。企业数据合规的前置清单可参照本站数据清单、权限与审计指南

生成式 AI 和智能体需要的不是普通“打标签”

大语言模型项目会把标注扩展为监督微调示范、偏好比较、事实核验、安全红队、评分量表、RAG 证据忠实度和智能体轨迹。Appen 当前数据产品页把专家 RLHF、推理轨迹、红队、Agent 轨迹、验证器和模型评估列为服务方向。厂商页面能证明“提供这类服务”,不能证明其在你的语言、领域和风险等级上必然达标。

目标 标注单元 最低证据
监督微调 问题、上下文、参考响应与拒答 来源可追溯、格式一致、污染和重复检查
偏好对齐 候选响应、排序、理由与置信度 盲评、顺序随机、分歧率和裁决记录
RAG 评估 查询、文档、答案、引用与不可回答 检索覆盖、忠实度、完整性和来源时效
Agent 评估 环境状态、工具调用、观察、结果和成本 沙箱、停止条件、副作用、重放和回滚
安全红队 攻击提示、响应、风险类别与严重度 受控访问、升级渠道、暴露限制和修复复测

如果读者还不清楚模型、Token 和训练阶段,可先看大语言模型基础指南;涉及检索问答时,再用RAG 架构与评测指南定义证据。把“回答更像人”当成唯一质量标准,会掩盖事实错误、拒答失败和工具误操作。

AI 预标注能提速,但不能自己证明正确

Appen 的 AI 预标注指南显示,团队可为特定题型配置语言模型,让贡献者接受或修改预标注,并选择是否提示“由 AI 预标注”。这可以减少重复输入,但也会产生锚定效应:人工更可能沿用模型给出的错误答案,特别是在难例、少数语言和专业领域。

预标注策略 收益假设 必须做的控制
无预标注 减少模型锚定 作为对照组,记录人工耗时与分歧
模型建议可修改 常见样本更快 隐藏一部分建议做盲评,统计接受率与错误率
模型 + 置信度 把人工集中到不确定样本 先校准置信度,不能把高分直接当正确
多模型或规则预标注 增加覆盖与交叉检查 记录模型版本、提示词、规则和冲突裁决

试点应同时保留“人工从零标注”和“AI 辅助标注”两个分支,用同一盲评金标比较合格样本成本,而不是只比较每小时完成条数。如果 AI 预标注提升吞吐却显著增加系统性偏差,整体成本可能反而更高。

质量体系的核心:标签本体、说明书与金标

高质量不是一个平台开关,而是对任务含义的共同约定。说明书至少应包含正例、反例、边界例、不可判定、需要专家升级的情形,以及每次规则变更的版本。金标不是永远正确的答案库,而是由具备资格的人员按当前规则裁决、可被复审的一组校准样本。

质量对象 应保存什么 不合格表现
标签本体 定义、父子关系、互斥与多选规则 同一词在不同页面含义不同
说明书 例子、边界、跳过、升级和版本 只写一句“按常识判断”
金标集 样本、答案、理由、裁决者和日期 从生产结果直接挑“看起来对”的样本
校准测试 人员得分、错误类型和再培训记录 一次通过后永久放行
变更日志 为何改、影响范围、是否需要重标 改规则却不更新旧数据

Appen 对质量方法的公开说明提到贡献者校准、金标准示例、多轮独立复核与统计抽样。采购方仍应要求看到适用于自己任务的设计,而不是把厂商方法论概述当成项目结果。

一致性不是准确率:必须按切片报告错误

两名标注员一致,可能只是共同误解规则;总体准确率很高,也可能因为容易样本占比过大。可靠报告至少同时展示对金标的准确性、标注者间一致性、不可判定率、升级率、返工率,以及语言、场景、设备、类别和风险严重度切片。

指标 回答的问题 常见误读
金标准确率/F1 对已裁决样本有多接近 把测试集结果外推到所有分布
标注者一致性 任务是否清晰、人员是否稳定 一致就等于正确
分歧与升级率 哪些样本需要专家或改规则 把分歧当低绩效直接删除
返工率 交付前后有多少结果需重做 只算人工修改,不算规则变更
严重错误率 高风险错误是否受控 用大量轻微正确样本稀释

抽样也要预先固定。只检查平台标记为“低置信度”的样本,会漏掉模型和人员都高置信但共同犯错的情况。建议保留随机样本、困难样本、少数群体和高风险样本四条独立抽样线。

数据采集先问权利和同意,再问数量

Appen 数据采集页描述了远程、现场、设备、位置与现成数据集等路径。每种路径都可能涉及不同的知情同意、肖像、声音、位置、生物特征、跨境传输和再使用限制。采购方要获得可操作的权利清单,而不是一句“数据已合规”。

尽调问题 合格证据 停止信号
数据从哪里来 来源类别、采集流程、时间和地区 只说“公开网络”或“合作渠道”
参与者同意什么 同意文本、用途、期限、撤回和补偿 训练、评估与再许可混成一个模糊授权
谁能访问 角色、地区、设备、分包商和日志 无法列出实际处理者
如何删除 主数据、缓存、导出和备份的删除流程 只删除平台界面记录
能否再训练 合同明确禁止或限定供应商二次使用 默认允许用于“改进服务”却无边界

教育、医疗、金融和儿童相关项目应提高门槛。本站的学生数据最小化与隐私指南展示了如何把“能收集”改写为“完成任务真正需要收集什么”。同一原则也适用于外包标注。

安全与合规:证书是入口,不是项目结论

ADAP 页面列出 GDPR、SOC、HIPAA 与 ISO/IEC 27001 等相关表述。企业应索取当前证书、适用实体、产品范围、地区和例外,并把结果映射到本项目的数据流。某项认证覆盖公司或平台,不自动意味着每个贡献者设备、分包商、导出文件和客户集成都在同一控制范围内。

控制面 试点要验证 交付证据
身份与权限 最小权限、MFA、项目隔离和离职回收 角色矩阵、访问日志与抽查记录
传输与存储 加密、区域、密钥、导出和临时文件 数据流图、配置与保留策略
贡献者环境 下载、截图、复制、个人设备和地点 策略、技术限制和违规处置
事件响应 检测、通知、隔离、取证和恢复 联系人、时限、演练与复盘模板
分包商 名单、地区、用途和同等义务 合同附件与变更通知机制

不要把敏感真实数据作为第一个演示样本。先用合成或脱敏数据验证流程,再逐级开放权限;涉及高风险数据时,由法律、安全和业务负责人共同签署范围。

自建、Appen 与其他平台怎么选

“平台功能最多”不是选型标准。若团队已有稳定本体、专家、工程与质量运营,自建可能获得更强控制;若缺人员和多语言采集能力,托管服务可能更快;若核心需求只是软件协作,可比较平台型产品。本站已完成的Labelbox 数据标注与模型评估指南可作为另一种平台视角,MTurk Requester/Worker 与风险指南则说明通用众包市场与企业数据平台不是同一类产品。

条件 偏向自建 偏向平台/服务
任务稳定性 本体稳定、长期重复、工程团队成熟 需求波动、需要快速试验或多种模态
专业人员 内部专家充足且可长期投入 需要多语言、地域或临时规模
数据敏感度 不能离开受控环境 供应商能证明隔离、地区与审计能力
质量运营 能维护金标、抽样、裁决和返工 需要供应商承担部分项目与质量管理
退出要求 必须完全掌握数据、代码与流程 合同允许完整导出、删除证明与迁移

比较时应给所有供应商相同样本、相同说明书和相同盲评金标。不要把厂商演示样本与自建真实难例比较,也不要让不同供应商自己定义“准确率”。

成本不能只看每条标签价格

单位报价通常忽略了任务设计、专家裁决、平台费、项目管理、数据传输、返工、安全审查和模型错误带来的下游损失。正确分母应是“通过盲评并可进入训练或评估集的合格样本”,而不是平台上点击完成的原始任务数。

成本项 如何记录 容易被遗漏
准备成本 本体、说明书、金标、脱敏和集成工时 业务专家的机会成本
生产成本 平台、人员、管理、API 与存储 最低承诺、并发和附加功能
质量成本 复核、裁决、抽样、返工和重标 规则变更造成的历史数据重做
风险成本 安全审计、事件、合规与错误影响 严重错误虽然少但代价高
退出成本 导出、格式转换、权限回收和删除验证 供应商专有工作流和不可导出元数据

试点报告应同时给出合格样本成本、95 分位交付周期、返工率、专家升级率和严重错误率。没有基线时,只能说“本轮观察值”,不能声称提升百分比。

模型评估项目要把“标签质量”连接到产品风险

训练数据通过抽检,并不代表上线模型已经可靠。标签项目回答的是“这批数据是否按当前规则制作”;模型评估还要回答“模型在真实用户、真实语言和真实工具环境中会怎样失败”。两者应共享任务本体、严重度和审计字段,但不能用同一批训练样本兼作最终测试集。否则团队可能只是在反复优化已知题目。

评估层 需要固定 需要持续更新
离线基准 保留集、评分规则、模型版本和运行参数 新出现的语言、领域与攻击类型
人工评审 盲评、随机顺序、资格、理由和裁决流程 容易混淆的边界例与评审培训
LLM-as-a-Judge 评审模型、提示词、采样和人工校准集 评审偏差、位置偏差和模型版本漂移
线上监控 事件字段、隐私处理、告警和响应负责人 用户反馈、真实失败和分布变化
回归测试 严重错误用例、期望行为和通过门槛 每次事故和修复形成的新测试

对 RAG 系统,标注员至少要区分“检索不到证据”“有证据但答案遗漏”“答案与证据矛盾”“引用位置不支持主张”;对智能体,还要记录工具选择、参数、权限、状态变化、是否可回滚以及停止条件。只给最终回答打一个 1–5 分,无法定位失败发生在检索、推理、工具还是环境。

评审人员也需要独立校准。专家并非天然一致,尤其是政策、法律、医学、财务和安全任务。项目应先让多名合格评审者独立处理同一批难例,再由指定裁决者形成规则;如果长期分歧来自问题本身不可判定,就应新增“不足以判断”或升级标签,而不是强迫所有人选择一个伪精确答案。

交付时,应把数据版本、样本来源、标签说明书版本、人员角色、预标注模型、最终裁决、评估代码、模型版本和运行日期连接起来。这样,模型更新后才能回答“分数为何变化”,事故发生后才能定位受影响的数据与流程。缺少这条追踪链,即使某次评估分数很高,也很难成为可审计的上线依据。

还应保留一个从未参与训练、提示词调整或人员校准的最终保留集,并限制访问。它不必很大,但要覆盖关键切片和高严重度失败。每次正式发布只运行一次,失败后先分析根因,再决定是否修复模型、检索、工具权限或数据;不要反复查看答案并把保留集变成新的训练集。

30 天试点怎么设计

试点不需要覆盖所有业务,但必须使用真实分布和可复现基线。第一周定义问题、样本、金标和安全边界;第二周做小批校准;第三周运行受控生产和盲评;第四周复测、核算单位经济性并执行一次完整导出与删除演练。

阶段 主要动作 通过条件
第 1–5 天 确定用途、标签、样本切片、风险与基线 说明书、金标、数据权利和责任人签字
第 6–10 天 配置任务、权限、集成并校准人员 难例分歧可解释,失败者不能进入生产
第 11–20 天 小批生产、随机盲评、记录返工与吞吐 各关键切片和严重错误均达门槛
第 21–25 天 修订规则并对同一保留集复测 改善来自规则或流程,不是更换测试集
第 26–30 天 成本核算、导出、删除、迁移和复盘 七道证据门全部通过,退出路径可执行
Appen或数据标注供应商试点的数据权利标签定义人员质量安全成本和退出七道证据门
扩量必须以七门全部通过为条件。任一门失败时,应缩小范围、修订规则或停止,而不是用更多标注量掩盖问题。图:兰塞 AI 编辑部原创。

合同、SLA 与退出条款要写到可执行

合同不应只写“按行业标准保证质量”。需要定义谁拥有原始数据、标签、说明书、金标、脚本、提示词和评估结果;哪些内容可被供应商用于改进服务;分包商和跨境处理如何通知;质量不达标如何返工;终止后何时导出和删除。

条款 建议写法方向 验收证据
质量 按任务与切片定义指标、样本量、盲评和严重度 原始评测明细与裁决记录
时效 区分普通、专家升级、返工和事件响应 时间戳、队列与超时原因
数据使用 限定目的、人员、地区、保留和二次使用 访问日志、分包商清单与删除证明
变更 功能、模型、人员、地区和价格变更需通知 版本日志与重新验收记录
退出 开放格式导出、依赖说明、撤权和删除时间 迁移演练与恢复验证

常见问题

CrowdFlower 或 Figure Eight 现在还能单独注册吗?

不应按旧教程寻找独立入口。它们是 Appen 当前体系之前的历史品牌。应从 Appen 当前官网和帮助中心确认 ADAP、服务或贡献者入口,并警惕冒用旧品牌的非官方登录页。

Appen 是软件平台还是外包公司?

两者都可能涉及:ADAP 是平台,Appen 也提供数据采集、标注、人员与项目服务。采购前要拆分许可、平台功能、人员来源、项目管理与专家服务,避免合同范围和实际预期错位。

平台能自动保证标注质量吗?

不能。平台可以支持测试题、路由、复核、分析和 AI 预标注,但标签定义、金标、抽样、专家裁决与错误责任仍需明确。任何“准确率”都必须说明样本、指标、切片和评测者。

AI 预标注会不会替代人工?

它可能减少部分重复工作,也可能引入锚定和系统性错误。是否有收益要通过同样本对照、盲评、分层错误率和合格样本成本验证,不能用完成速度单独判断。

小团队是否适合 Appen?

取决于数据量、专业性、预算、合同门槛和内部质量能力。小团队可以先用几十到几百个代表性样本做供应商中立的试点;若准备说明书和金标的成本都无法承担,也不应直接扩量。

最终选型清单

问题 扩量前必须回答
我们为什么标注 对应哪个模型决策、产品行为或评估结论
数据是否合法可用 来源、同意、用途、地区、期限和删除是否明确
什么叫正确 本体、说明书、难例、金标和专家裁决是否齐全
谁在处理 资格、培训、地点、设备、权限和分包商是否可核验
如何发现失败 随机与风险抽样、切片、严重度、分歧和返工是否记录
成本是否真实 是否按合格样本计算并包含准备、质量、风险和退出
能否离开 数据、标签、元数据、脚本、日志和删除证明是否可获得

结论:CrowdFlower 和 Figure Eight 的价值主要在历史脉络;今天的采购对象是 Appen 当前平台与服务。真正专业的决策不从“有多少标注员、支持多少模态”开始,而从一个具体模型问题、一组真实样本和一条可审计质量链开始。先证明数据权利、定义、人员、质量、安全、成本与退出,再扩量。若供应商无法在小试点里交付这些证据,更多功能和更大规模都不能弥补基础缺口。

来源与复核:本文依据 Appen 当前公司与历史说明ADAP 产品页数据标注服务页数据采集页、平台帮助中心、更名与收购公告整理,复核日期为 2026 年 7 月 18 日。产品、套餐、地区、合规范围和帮助中心界面可能变化,采购前应以当前书面合同与实际租户验证为准。本站的来源、更新与纠错原则见关于本站与编辑规范