一句话答案:CrowdFlower 在 2018 年更名为 Figure Eight,Appen 于 2019 年宣布并完成收购;今天搜索这两个旧品牌,真正需要评估的是 Appen 当前的 AI Data Platform(ADAP)、数据采集与标注服务、贡献者体系以及面向大模型和智能体的训练与评估能力。它不是“上传数据就自动得到高质量标签”的魔法工具,也不应只按每条标签价格选型。可靠项目必须同时定义数据权利、标签本体、人员资格、质量抽检、安全边界、模型评估、返工和退出方式。

CrowdFlower、Figure Eight 与 Appen 到底是什么关系
2018 年更名公告显示,CrowdFlower 当时将公司名称改为 Figure Eight;Appen 2019 年收购公告又明确写明 Figure Eight 以前名为 CrowdFlower,并计划把平台与 Appen 的全球数据能力结合。因而旧教程里的 CrowdFlower 控制台、Figure Eight 注册入口、套餐和按钮路径均不能直接套用到今天。
| 名称 | 应如何理解 | 今天该做什么 |
|---|---|---|
| CrowdFlower | 2007 年创立的历史品牌,后来更名 | 只用于理解旧资料、旧 API 或历史案例 |
| Figure Eight | 2018 年后的品牌名,2019 年被 Appen 收购 | 遇到旧域名和旧教程时回查 Appen 当前文档 |
| Appen ADAP | 当前 Appen AI Data Platform 的产品名称 | 按当前租户、合同、地区和功能开关逐项核验 |
| Appen 服务 | 平台之外的数据采集、人员、项目和专家服务 | 区分软件能力、人员服务和客户自己的责任 |

Appen 现在提供什么:平台、数据与服务要拆开看
Appen ADAP 产品页把当前平台描述为自动化与人工监督结合的标注环境,覆盖文本、图像、音频、视频、地理空间等数据,并提供任务配置、工作流、质量控制、人员管理和 API 集成。AI 训练数据总览还列出模型对齐、智能体轨迹、多模态、物理 AI 和模型评估等数据服务。这里必须区分“软件中存在某个能力”与“你的账户、项目和地区已包含该能力”。
| 层 | 主要对象 | 客户仍需负责 |
|---|---|---|
| 平台层 | 任务设计、标注界面、路由、复核、分析与导出 | 本体、说明书、权限、集成、版本和验收 |
| 数据层 | 客户数据、定制采集、现成数据集与衍生标签 | 来源、许可、同意、用途限制、保留与删除 |
| 人员层 | 内部专家、供应商团队或全球贡献者 | 资格要求、培训、冲突、薪酬与升级路径 |
| 服务层 | 项目管理、质量运营、专家审核和咨询 | 交付边界、责任人、SLA、变更与退出 |
Appen 平台概览说明,实际界面会随团队启用的功能而变化,Quality Flow 可用于持续或抽样质检、向贡献者反馈、调查个人质量和在项目内串联多步操作。这恰好说明截图教程很容易过时;本文更关注职责、证据和验收,而不是写死按钮位置。
哪些数据和任务适合放入标注平台
Appen 数据标注服务页列出的任务包含文本意图、实体、情感与相关性,图像框选、分割与关键点,语音转写、说话人分离,以及视频动作识别。与本站的自然语言处理任务地图、计算机视觉项目方法结合看,选工具前应先确认模型需要的学习信号,而不是先选一个界面再寻找用途。
| 数据模态 | 典型任务 | 最容易漏掉的验收项 |
|---|---|---|
| 文本 | 分类、实体、关系、相关性、偏好与安全 | 上下文、语言变体、歧义和不可判定标签 |
| 图像 | 分类、框、分割、关键点、OCR | 遮挡、小目标、边界规则和空样本 |
| 音频 | 转写、说话人、事件、情感和口音 | 重叠语音、噪声、时间戳和隐私信息 |
| 视频/3D | 跟踪、动作、时序分割、点云与传感器融合 | 跨帧一致性、坐标系、插值和长序列上下文 |
| LLM/Agent | 示范、偏好、红队、轨迹、验证器和 RAG 评估 | 工具副作用、事实来源、失败严重度和可复现环境 |
数据量大不等于适合众包。受限医疗影像、未脱敏日志、商业机密、儿童数据、精确位置或高风险决策记录,可能需要封闭环境、具备资质的专家、地区隔离甚至完全不外发。企业数据合规的前置清单可参照本站数据清单、权限与审计指南。
生成式 AI 和智能体需要的不是普通“打标签”
大语言模型项目会把标注扩展为监督微调示范、偏好比较、事实核验、安全红队、评分量表、RAG 证据忠实度和智能体轨迹。Appen 当前数据产品页把专家 RLHF、推理轨迹、红队、Agent 轨迹、验证器和模型评估列为服务方向。厂商页面能证明“提供这类服务”,不能证明其在你的语言、领域和风险等级上必然达标。
| 目标 | 标注单元 | 最低证据 |
|---|---|---|
| 监督微调 | 问题、上下文、参考响应与拒答 | 来源可追溯、格式一致、污染和重复检查 |
| 偏好对齐 | 候选响应、排序、理由与置信度 | 盲评、顺序随机、分歧率和裁决记录 |
| RAG 评估 | 查询、文档、答案、引用与不可回答 | 检索覆盖、忠实度、完整性和来源时效 |
| Agent 评估 | 环境状态、工具调用、观察、结果和成本 | 沙箱、停止条件、副作用、重放和回滚 |
| 安全红队 | 攻击提示、响应、风险类别与严重度 | 受控访问、升级渠道、暴露限制和修复复测 |
如果读者还不清楚模型、Token 和训练阶段,可先看大语言模型基础指南;涉及检索问答时,再用RAG 架构与评测指南定义证据。把“回答更像人”当成唯一质量标准,会掩盖事实错误、拒答失败和工具误操作。
AI 预标注能提速,但不能自己证明正确
Appen 的 AI 预标注指南显示,团队可为特定题型配置语言模型,让贡献者接受或修改预标注,并选择是否提示“由 AI 预标注”。这可以减少重复输入,但也会产生锚定效应:人工更可能沿用模型给出的错误答案,特别是在难例、少数语言和专业领域。
| 预标注策略 | 收益假设 | 必须做的控制 |
|---|---|---|
| 无预标注 | 减少模型锚定 | 作为对照组,记录人工耗时与分歧 |
| 模型建议可修改 | 常见样本更快 | 隐藏一部分建议做盲评,统计接受率与错误率 |
| 模型 + 置信度 | 把人工集中到不确定样本 | 先校准置信度,不能把高分直接当正确 |
| 多模型或规则预标注 | 增加覆盖与交叉检查 | 记录模型版本、提示词、规则和冲突裁决 |
试点应同时保留“人工从零标注”和“AI 辅助标注”两个分支,用同一盲评金标比较合格样本成本,而不是只比较每小时完成条数。如果 AI 预标注提升吞吐却显著增加系统性偏差,整体成本可能反而更高。
质量体系的核心:标签本体、说明书与金标
高质量不是一个平台开关,而是对任务含义的共同约定。说明书至少应包含正例、反例、边界例、不可判定、需要专家升级的情形,以及每次规则变更的版本。金标不是永远正确的答案库,而是由具备资格的人员按当前规则裁决、可被复审的一组校准样本。
| 质量对象 | 应保存什么 | 不合格表现 |
|---|---|---|
| 标签本体 | 定义、父子关系、互斥与多选规则 | 同一词在不同页面含义不同 |
| 说明书 | 例子、边界、跳过、升级和版本 | 只写一句“按常识判断” |
| 金标集 | 样本、答案、理由、裁决者和日期 | 从生产结果直接挑“看起来对”的样本 |
| 校准测试 | 人员得分、错误类型和再培训记录 | 一次通过后永久放行 |
| 变更日志 | 为何改、影响范围、是否需要重标 | 改规则却不更新旧数据 |
Appen 对质量方法的公开说明提到贡献者校准、金标准示例、多轮独立复核与统计抽样。采购方仍应要求看到适用于自己任务的设计,而不是把厂商方法论概述当成项目结果。
一致性不是准确率:必须按切片报告错误
两名标注员一致,可能只是共同误解规则;总体准确率很高,也可能因为容易样本占比过大。可靠报告至少同时展示对金标的准确性、标注者间一致性、不可判定率、升级率、返工率,以及语言、场景、设备、类别和风险严重度切片。
| 指标 | 回答的问题 | 常见误读 |
|---|---|---|
| 金标准确率/F1 | 对已裁决样本有多接近 | 把测试集结果外推到所有分布 |
| 标注者一致性 | 任务是否清晰、人员是否稳定 | 一致就等于正确 |
| 分歧与升级率 | 哪些样本需要专家或改规则 | 把分歧当低绩效直接删除 |
| 返工率 | 交付前后有多少结果需重做 | 只算人工修改,不算规则变更 |
| 严重错误率 | 高风险错误是否受控 | 用大量轻微正确样本稀释 |
抽样也要预先固定。只检查平台标记为“低置信度”的样本,会漏掉模型和人员都高置信但共同犯错的情况。建议保留随机样本、困难样本、少数群体和高风险样本四条独立抽样线。
数据采集先问权利和同意,再问数量
Appen 数据采集页描述了远程、现场、设备、位置与现成数据集等路径。每种路径都可能涉及不同的知情同意、肖像、声音、位置、生物特征、跨境传输和再使用限制。采购方要获得可操作的权利清单,而不是一句“数据已合规”。
| 尽调问题 | 合格证据 | 停止信号 |
|---|---|---|
| 数据从哪里来 | 来源类别、采集流程、时间和地区 | 只说“公开网络”或“合作渠道” |
| 参与者同意什么 | 同意文本、用途、期限、撤回和补偿 | 训练、评估与再许可混成一个模糊授权 |
| 谁能访问 | 角色、地区、设备、分包商和日志 | 无法列出实际处理者 |
| 如何删除 | 主数据、缓存、导出和备份的删除流程 | 只删除平台界面记录 |
| 能否再训练 | 合同明确禁止或限定供应商二次使用 | 默认允许用于“改进服务”却无边界 |
教育、医疗、金融和儿童相关项目应提高门槛。本站的学生数据最小化与隐私指南展示了如何把“能收集”改写为“完成任务真正需要收集什么”。同一原则也适用于外包标注。
安全与合规:证书是入口,不是项目结论
ADAP 页面列出 GDPR、SOC、HIPAA 与 ISO/IEC 27001 等相关表述。企业应索取当前证书、适用实体、产品范围、地区和例外,并把结果映射到本项目的数据流。某项认证覆盖公司或平台,不自动意味着每个贡献者设备、分包商、导出文件和客户集成都在同一控制范围内。
| 控制面 | 试点要验证 | 交付证据 |
|---|---|---|
| 身份与权限 | 最小权限、MFA、项目隔离和离职回收 | 角色矩阵、访问日志与抽查记录 |
| 传输与存储 | 加密、区域、密钥、导出和临时文件 | 数据流图、配置与保留策略 |
| 贡献者环境 | 下载、截图、复制、个人设备和地点 | 策略、技术限制和违规处置 |
| 事件响应 | 检测、通知、隔离、取证和恢复 | 联系人、时限、演练与复盘模板 |
| 分包商 | 名单、地区、用途和同等义务 | 合同附件与变更通知机制 |
不要把敏感真实数据作为第一个演示样本。先用合成或脱敏数据验证流程,再逐级开放权限;涉及高风险数据时,由法律、安全和业务负责人共同签署范围。
自建、Appen 与其他平台怎么选
“平台功能最多”不是选型标准。若团队已有稳定本体、专家、工程与质量运营,自建可能获得更强控制;若缺人员和多语言采集能力,托管服务可能更快;若核心需求只是软件协作,可比较平台型产品。本站已完成的Labelbox 数据标注与模型评估指南可作为另一种平台视角,MTurk Requester/Worker 与风险指南则说明通用众包市场与企业数据平台不是同一类产品。
| 条件 | 偏向自建 | 偏向平台/服务 |
|---|---|---|
| 任务稳定性 | 本体稳定、长期重复、工程团队成熟 | 需求波动、需要快速试验或多种模态 |
| 专业人员 | 内部专家充足且可长期投入 | 需要多语言、地域或临时规模 |
| 数据敏感度 | 不能离开受控环境 | 供应商能证明隔离、地区与审计能力 |
| 质量运营 | 能维护金标、抽样、裁决和返工 | 需要供应商承担部分项目与质量管理 |
| 退出要求 | 必须完全掌握数据、代码与流程 | 合同允许完整导出、删除证明与迁移 |
比较时应给所有供应商相同样本、相同说明书和相同盲评金标。不要把厂商演示样本与自建真实难例比较,也不要让不同供应商自己定义“准确率”。
成本不能只看每条标签价格
单位报价通常忽略了任务设计、专家裁决、平台费、项目管理、数据传输、返工、安全审查和模型错误带来的下游损失。正确分母应是“通过盲评并可进入训练或评估集的合格样本”,而不是平台上点击完成的原始任务数。
| 成本项 | 如何记录 | 容易被遗漏 |
|---|---|---|
| 准备成本 | 本体、说明书、金标、脱敏和集成工时 | 业务专家的机会成本 |
| 生产成本 | 平台、人员、管理、API 与存储 | 最低承诺、并发和附加功能 |
| 质量成本 | 复核、裁决、抽样、返工和重标 | 规则变更造成的历史数据重做 |
| 风险成本 | 安全审计、事件、合规与错误影响 | 严重错误虽然少但代价高 |
| 退出成本 | 导出、格式转换、权限回收和删除验证 | 供应商专有工作流和不可导出元数据 |
试点报告应同时给出合格样本成本、95 分位交付周期、返工率、专家升级率和严重错误率。没有基线时,只能说“本轮观察值”,不能声称提升百分比。
模型评估项目要把“标签质量”连接到产品风险
训练数据通过抽检,并不代表上线模型已经可靠。标签项目回答的是“这批数据是否按当前规则制作”;模型评估还要回答“模型在真实用户、真实语言和真实工具环境中会怎样失败”。两者应共享任务本体、严重度和审计字段,但不能用同一批训练样本兼作最终测试集。否则团队可能只是在反复优化已知题目。
| 评估层 | 需要固定 | 需要持续更新 |
|---|---|---|
| 离线基准 | 保留集、评分规则、模型版本和运行参数 | 新出现的语言、领域与攻击类型 |
| 人工评审 | 盲评、随机顺序、资格、理由和裁决流程 | 容易混淆的边界例与评审培训 |
| LLM-as-a-Judge | 评审模型、提示词、采样和人工校准集 | 评审偏差、位置偏差和模型版本漂移 |
| 线上监控 | 事件字段、隐私处理、告警和响应负责人 | 用户反馈、真实失败和分布变化 |
| 回归测试 | 严重错误用例、期望行为和通过门槛 | 每次事故和修复形成的新测试 |
对 RAG 系统,标注员至少要区分“检索不到证据”“有证据但答案遗漏”“答案与证据矛盾”“引用位置不支持主张”;对智能体,还要记录工具选择、参数、权限、状态变化、是否可回滚以及停止条件。只给最终回答打一个 1–5 分,无法定位失败发生在检索、推理、工具还是环境。
评审人员也需要独立校准。专家并非天然一致,尤其是政策、法律、医学、财务和安全任务。项目应先让多名合格评审者独立处理同一批难例,再由指定裁决者形成规则;如果长期分歧来自问题本身不可判定,就应新增“不足以判断”或升级标签,而不是强迫所有人选择一个伪精确答案。
交付时,应把数据版本、样本来源、标签说明书版本、人员角色、预标注模型、最终裁决、评估代码、模型版本和运行日期连接起来。这样,模型更新后才能回答“分数为何变化”,事故发生后才能定位受影响的数据与流程。缺少这条追踪链,即使某次评估分数很高,也很难成为可审计的上线依据。
还应保留一个从未参与训练、提示词调整或人员校准的最终保留集,并限制访问。它不必很大,但要覆盖关键切片和高严重度失败。每次正式发布只运行一次,失败后先分析根因,再决定是否修复模型、检索、工具权限或数据;不要反复查看答案并把保留集变成新的训练集。
30 天试点怎么设计
试点不需要覆盖所有业务,但必须使用真实分布和可复现基线。第一周定义问题、样本、金标和安全边界;第二周做小批校准;第三周运行受控生产和盲评;第四周复测、核算单位经济性并执行一次完整导出与删除演练。
| 阶段 | 主要动作 | 通过条件 |
|---|---|---|
| 第 1–5 天 | 确定用途、标签、样本切片、风险与基线 | 说明书、金标、数据权利和责任人签字 |
| 第 6–10 天 | 配置任务、权限、集成并校准人员 | 难例分歧可解释,失败者不能进入生产 |
| 第 11–20 天 | 小批生产、随机盲评、记录返工与吞吐 | 各关键切片和严重错误均达门槛 |
| 第 21–25 天 | 修订规则并对同一保留集复测 | 改善来自规则或流程,不是更换测试集 |
| 第 26–30 天 | 成本核算、导出、删除、迁移和复盘 | 七道证据门全部通过,退出路径可执行 |

合同、SLA 与退出条款要写到可执行
合同不应只写“按行业标准保证质量”。需要定义谁拥有原始数据、标签、说明书、金标、脚本、提示词和评估结果;哪些内容可被供应商用于改进服务;分包商和跨境处理如何通知;质量不达标如何返工;终止后何时导出和删除。
| 条款 | 建议写法方向 | 验收证据 |
|---|---|---|
| 质量 | 按任务与切片定义指标、样本量、盲评和严重度 | 原始评测明细与裁决记录 |
| 时效 | 区分普通、专家升级、返工和事件响应 | 时间戳、队列与超时原因 |
| 数据使用 | 限定目的、人员、地区、保留和二次使用 | 访问日志、分包商清单与删除证明 |
| 变更 | 功能、模型、人员、地区和价格变更需通知 | 版本日志与重新验收记录 |
| 退出 | 开放格式导出、依赖说明、撤权和删除时间 | 迁移演练与恢复验证 |
常见问题
CrowdFlower 或 Figure Eight 现在还能单独注册吗?
不应按旧教程寻找独立入口。它们是 Appen 当前体系之前的历史品牌。应从 Appen 当前官网和帮助中心确认 ADAP、服务或贡献者入口,并警惕冒用旧品牌的非官方登录页。
Appen 是软件平台还是外包公司?
两者都可能涉及:ADAP 是平台,Appen 也提供数据采集、标注、人员与项目服务。采购前要拆分许可、平台功能、人员来源、项目管理与专家服务,避免合同范围和实际预期错位。
平台能自动保证标注质量吗?
不能。平台可以支持测试题、路由、复核、分析和 AI 预标注,但标签定义、金标、抽样、专家裁决与错误责任仍需明确。任何“准确率”都必须说明样本、指标、切片和评测者。
AI 预标注会不会替代人工?
它可能减少部分重复工作,也可能引入锚定和系统性错误。是否有收益要通过同样本对照、盲评、分层错误率和合格样本成本验证,不能用完成速度单独判断。
小团队是否适合 Appen?
取决于数据量、专业性、预算、合同门槛和内部质量能力。小团队可以先用几十到几百个代表性样本做供应商中立的试点;若准备说明书和金标的成本都无法承担,也不应直接扩量。
最终选型清单
| 问题 | 扩量前必须回答 |
|---|---|
| 我们为什么标注 | 对应哪个模型决策、产品行为或评估结论 |
| 数据是否合法可用 | 来源、同意、用途、地区、期限和删除是否明确 |
| 什么叫正确 | 本体、说明书、难例、金标和专家裁决是否齐全 |
| 谁在处理 | 资格、培训、地点、设备、权限和分包商是否可核验 |
| 如何发现失败 | 随机与风险抽样、切片、严重度、分歧和返工是否记录 |
| 成本是否真实 | 是否按合格样本计算并包含准备、质量、风险和退出 |
| 能否离开 | 数据、标签、元数据、脚本、日志和删除证明是否可获得 |
结论:CrowdFlower 和 Figure Eight 的价值主要在历史脉络;今天的采购对象是 Appen 当前平台与服务。真正专业的决策不从“有多少标注员、支持多少模态”开始,而从一个具体模型问题、一组真实样本和一条可审计质量链开始。先证明数据权利、定义、人员、质量、安全、成本与退出,再扩量。若供应商无法在小试点里交付这些证据,更多功能和更大规模都不能弥补基础缺口。
来源与复核:本文依据 Appen 当前公司与历史说明、ADAP 产品页、数据标注服务页、数据采集页、平台帮助中心、更名与收购公告整理,复核日期为 2026 年 7 月 18 日。产品、套餐、地区、合规范围和帮助中心界面可能变化,采购前应以当前书面合同与实际租户验证为准。本站的来源、更新与纠错原则见关于本站与编辑规范。
