AI概念与词典

词向量是什么?Word2Vec、上下文嵌入、相似度与局限

词向量把词或子词映射为数值向量。本文区分Word2Vec、GloVe、fastText、BERT上下文表示与句向量,解释相似度、训练边界和常见误用。

词向量是什么?Word2Vec、上下文嵌入、相似度与局限:官方来源、使用边界与人工验收流程
本页目录
  1. 先看结论与操作顺序
  2. 从 one-hot 到分布式表示
  3. 静态、子词和上下文嵌入
  4. 余弦相似度能说明什么
  5. 偏差、漂移与复现
  6. 最小可复核记录
  7. 何时停止或切换方案
  8. 版本变化后怎么复查
  9. 常见问题
  10. 工具给出的高分或顺利输出是否代表结果可靠?
  11. 为什么不保留旧稿里的“深度评测”和精确提升数字?
  12. 相关站内指南
  13. 来源与复核记录
  14. 相关产品的最新官方状态

直接答案:词向量是模型学习得到的数值表示,使词语可以参与距离、相似度和机器学习计算。Word2Vec、GloVe 通常给一个词较固定的向量;fastText 利用子词信息;BERT 等上下文模型会让同一个词在不同句子中得到不同表示。向量相近只表示训练数据中的分布相似,不等于事实相同或价值判断正确。

旧稿更正:旧稿把词向量简单描述成低维实数向量,并用“国王减男人加女人”当作普遍可靠结论,却没有区分静态词向量、子词、上下文嵌入和句向量,也没有说明语料偏差与相似度边界。本次补齐模型谱系与可复核实验。

先看结论与操作顺序

方法 表示单位 特点与限制
Word2Vec CBOW/Skip-gram;多义词通常只有一个向量
GloVe 利用全局共现统计;仍是静态表示
fastText 词 + 字符子词 对未登录词更友好;依赖语言与切分
BERT 上下文中的子词 同词随上下文变化;不能直接当句向量
Sentence-BERT 句子/段落 适合语义检索;仍需领域评估
词向量 从输入、辅助处理到人工验收的三步流程
流程图由兰塞 AI 编辑部原创,用于说明本文的复核顺序。

从 one-hot 到分布式表示

one-hot 只给每个词一个独立位置,无法表达“猫”和“狗”比“猫”和“冰箱”更相近。分布式表示通过训练语料中的上下文学习稠密向量,使相似用法在空间中更靠近。维度本身通常没有可直接命名的单一语义。

静态、子词和上下文嵌入

Word2Vec 的 CBOW 与 Skip-gram 从邻近词预测中学习表示;GloVe 使用共现统计;fastText 把词分解为字符 n-gram,有助于形态变化和未登录词。BERT 使用子词与上下文,让“苹果公司”和“苹果水果”的表示不同。

余弦相似度能说明什么

余弦相似度比较方向,不直接表示事实正确、因果关系或可替代性。做检索时应固定模型、归一化方式、语料和阈值,并用真实查询—文档对评估召回率、准确率或排序指标。跨模型的分数不能直接比较。

偏差、漂移与复现

向量会继承训练语料的刻板印象、领域偏差和时间边界。敏感场景需要偏差测试与人工复核。可复现实验至少记录模型版本、tokenizer、池化方法、归一化、数据集、距离函数和评估脚本;不要只展示几个精心挑选的相似词。

最小可复核记录

如果要把结果用于团队交付、采购或公开发布,不要只保存最后一张图、一段文字或一个分数。至少记录下面五类信息,确保同事能够判断当时使用了什么、为什么得到该结果,以及变化后如何复查。涉及第三方素材时,还应单独保存授权范围和到期时间。

记录项 应保存内容 用途
环境 产品/模型/版本、计划、设备或浏览器 区分版本差异
输入 原始提示、文件、参考素材与脱敏说明 复现与权利核对
参数 尺寸、时长、seed、采样或功能开关 定位变量
输出 原始结果、时间、错误信息与人工修改 比较质量和失败
验收 准确性、完整性、成本、隐私、可回滚 决定是否交付

何时停止或切换方案

连续两到三次只改变一个变量仍无法满足核心验收条件时,应暂停继续消耗费用,回到输入和工具选择,而不是无限重试。若任务需要工具当前没有的精确文字、长时一致性、强权限隔离、可审计引用或确定性输出,应改用人工流程、传统软件或另一个经过验证的产品。任何需要上传密钥、身份证件、客户机密或未授权作品才能“正常使用”的方案,都不应继续。

版本变化后怎么复查

产品页面、模型、套餐、默认开关和帮助文档可能随时调整。复查时不要只改文章年份:先打开本文列出的官方入口,确认功能仍可用,再用同一组最小样本重跑关键步骤,比较输入、输出、费用和错误信息。若结论发生变化,应在正文说明变更内容与复核日期;若官方已经撤回能力或无法继续确认,则删除旧断言,而不是用“最新”“升级”掩盖差异。

常见问题

工具给出的高分或顺利输出是否代表结果可靠?

不代表。分数、预览和单次输出只说明某些规则或样本通过,不能替代来源核验、真实任务测试、权利检查和上线后的实页 QA。

为什么不保留旧稿里的“深度评测”和精确提升数字?

本站没有对应版本、测试输入、硬件、原始输出、样本量和复现记录。无法审计的经验与数字不能继续作为事实展示。

相关站内指南

来源与复核记录

本文于 2026 年 8 月 8 日依据以下一手资料复核;功能、版本、价格和限制会变化,使用前请重新打开官方页面确认。

编辑说明:本文由兰塞 AI 编辑流程重写,保留原 URL 与原发布日期;未冒充本站做过不存在的实测,原创流程图仅表达检查方法,不代表厂商界面或性能结果。