直接答案:词向量是模型学习得到的数值表示,使词语可以参与距离、相似度和机器学习计算。Word2Vec、GloVe 通常给一个词较固定的向量;fastText 利用子词信息;BERT 等上下文模型会让同一个词在不同句子中得到不同表示。向量相近只表示训练数据中的分布相似,不等于事实相同或价值判断正确。
旧稿更正:旧稿把词向量简单描述成低维实数向量,并用“国王减男人加女人”当作普遍可靠结论,却没有区分静态词向量、子词、上下文嵌入和句向量,也没有说明语料偏差与相似度边界。本次补齐模型谱系与可复核实验。
先看结论与操作顺序
| 方法 | 表示单位 | 特点与限制 |
|---|---|---|
| Word2Vec | 词 | CBOW/Skip-gram;多义词通常只有一个向量 |
| GloVe | 词 | 利用全局共现统计;仍是静态表示 |
| fastText | 词 + 字符子词 | 对未登录词更友好;依赖语言与切分 |
| BERT | 上下文中的子词 | 同词随上下文变化;不能直接当句向量 |
| Sentence-BERT | 句子/段落 | 适合语义检索;仍需领域评估 |
从 one-hot 到分布式表示
one-hot 只给每个词一个独立位置,无法表达“猫”和“狗”比“猫”和“冰箱”更相近。分布式表示通过训练语料中的上下文学习稠密向量,使相似用法在空间中更靠近。维度本身通常没有可直接命名的单一语义。
静态、子词和上下文嵌入
Word2Vec 的 CBOW 与 Skip-gram 从邻近词预测中学习表示;GloVe 使用共现统计;fastText 把词分解为字符 n-gram,有助于形态变化和未登录词。BERT 使用子词与上下文,让“苹果公司”和“苹果水果”的表示不同。
余弦相似度能说明什么
余弦相似度比较方向,不直接表示事实正确、因果关系或可替代性。做检索时应固定模型、归一化方式、语料和阈值,并用真实查询—文档对评估召回率、准确率或排序指标。跨模型的分数不能直接比较。
偏差、漂移与复现
向量会继承训练语料的刻板印象、领域偏差和时间边界。敏感场景需要偏差测试与人工复核。可复现实验至少记录模型版本、tokenizer、池化方法、归一化、数据集、距离函数和评估脚本;不要只展示几个精心挑选的相似词。
最小可复核记录
如果要把结果用于团队交付、采购或公开发布,不要只保存最后一张图、一段文字或一个分数。至少记录下面五类信息,确保同事能够判断当时使用了什么、为什么得到该结果,以及变化后如何复查。涉及第三方素材时,还应单独保存授权范围和到期时间。
| 记录项 | 应保存内容 | 用途 |
|---|---|---|
| 环境 | 产品/模型/版本、计划、设备或浏览器 | 区分版本差异 |
| 输入 | 原始提示、文件、参考素材与脱敏说明 | 复现与权利核对 |
| 参数 | 尺寸、时长、seed、采样或功能开关 | 定位变量 |
| 输出 | 原始结果、时间、错误信息与人工修改 | 比较质量和失败 |
| 验收 | 准确性、完整性、成本、隐私、可回滚 | 决定是否交付 |
何时停止或切换方案
连续两到三次只改变一个变量仍无法满足核心验收条件时,应暂停继续消耗费用,回到输入和工具选择,而不是无限重试。若任务需要工具当前没有的精确文字、长时一致性、强权限隔离、可审计引用或确定性输出,应改用人工流程、传统软件或另一个经过验证的产品。任何需要上传密钥、身份证件、客户机密或未授权作品才能“正常使用”的方案,都不应继续。
版本变化后怎么复查
产品页面、模型、套餐、默认开关和帮助文档可能随时调整。复查时不要只改文章年份:先打开本文列出的官方入口,确认功能仍可用,再用同一组最小样本重跑关键步骤,比较输入、输出、费用和错误信息。若结论发生变化,应在正文说明变更内容与复核日期;若官方已经撤回能力或无法继续确认,则删除旧断言,而不是用“最新”“升级”掩盖差异。
常见问题
工具给出的高分或顺利输出是否代表结果可靠?
不代表。分数、预览和单次输出只说明某些规则或样本通过,不能替代来源核验、真实任务测试、权利检查和上线后的实页 QA。
为什么不保留旧稿里的“深度评测”和精确提升数字?
本站没有对应版本、测试输入、硬件、原始输出、样本量和复现记录。无法审计的经验与数字不能继续作为事实展示。
相关站内指南
来源与复核记录
本文于 2026 年 8 月 8 日依据以下一手资料复核;功能、版本、价格和限制会变化,使用前请重新打开官方页面确认。
编辑说明:本文由兰塞 AI 编辑流程重写,保留原 URL 与原发布日期;未冒充本站做过不存在的实测,原创流程图仅表达检查方法,不代表厂商界面或性能结果。
