AI概念与词典

Llama 3 是什么?版本区别、架构、部署、评测与许可指南

Llama3是Meta于2024年发布的8B/70B文本模型,原始版本为8K上下文;405B、128K、视觉和端侧小模型分别属于后续3.1/3.2。本文按官方模型卡厘清版本、Base/Instruct、部署资源、量化、中文评测和许可边界。

Llama 3 到 Llama 3.3 的发布时间参数规模上下文和模态版本对照图
本页目录
  1. Llama 3 是什么?官方规格是什么?
  2. Llama 3、3.1、3.2、3.3 有什么区别?
  3. Llama 3 的架构有哪些可确认事实?
  4. Base 与 Instruct 应该怎样选?
  5. 模型权重、量化格式和运行时不是一回事
  6. 怎样估算内存和显存?
  7. 部署方式怎样选择?
  8. 中文场景能直接用原始 Llama 3 吗?
  9. 什么时候用 RAG,什么时候微调?
  10. Llama 3 的社区许可怎样理解?
  11. 官方基准能否证明适合你的业务?
  12. 性能测试应该怎样记录?
  13. 已有 Llama 3 系统要不要迁移?
  14. 模型知识截止与“最新回答”怎样处理?
  15. 安全、隐私和供应链要检查什么?
  16. 常见故障怎样排查?
  17. 生产上线清单
  18. 常见问题
  19. Llama 3 是真正的开源软件许可证吗?
  20. Llama 3 8B 能在消费级电脑运行吗?
  21. 原始 Llama 3 支持 128K 吗?
  22. Llama 3 适合中文知识库吗?
  23. 编辑复核与纠错记录

直接回答:Llama 3 是 Meta 于 2024 年 4 月 18 日发布的一组文本大语言模型,原始版本包含 8B 和 70B 两种参数规模,各有预训练版与指令微调版,上下文长度为 8K。它采用 decoder-only Transformer、128K 词表的 tokenizer,并在两个规模上使用 GQA(Grouped-Query Attention)以提高推理效率。

需要特别区分:405B、128K 上下文和官方多语言支持属于 Llama 3.1;1B/3B 端侧文本模型与 11B/90B 视觉模型属于 Llama 3.2;Llama 3.3 是 70B 文本模型。它们都属于 3.x 家族,但不是原始 Llama 3 的规格。2026 年选型时,应写完整模型 ID 和版本,不能只写“Llama 3”。

旧稿纠错:旧稿把 405B、128K、视觉能力和端侧小模型混写成原始 Llama 3,还用没有模型文件、量化方式、硬件、上下文、并发和原始日志的显卡速度与竞品结论作为“实测”。本次删除这些断言,并把官方规格、许可原文、资源估算与任务级评测分开。
Llama 3 到 Llama 3.3 的发布时间参数规模上下文和模态版本对照图
图 1:Llama 3.x 是多个正式版本,不是一组可以混用的能力标签。

Llama 3 是什么?官方规格是什么?

Meta 的 Llama 3 发布说明官方模型卡记录了原始版本边界:8B/70B、文本输入与文本/代码输出、8,192 训练序列长度、预训练与指令微调两类权重。模型卡把原始 Llama 3 的预期用途写为英语商业和研究场景,并要求开发者为自身应用做安全测试。

项目 原始 Llama 3 容易混淆的说法
发布日期 2024-04-18 把整个 3.x 家族都称为同日发布
参数规模 8B、70B 405B 属于 Llama 3.1
上下文 8K 128K 属于后续 3.1/3.2/3.3
模态 文本输入,文本与代码输出 视觉模型属于 Llama 3.2-Vision
变体 Pretrained、Instruct 社区量化不是 Meta 新模型版本
主要官方用途 英语商业与研究;Instruct 面向对话 不能据此保证中文生产质量

Llama 3 是大语言模型的一个具体家族,不是聊天应用、知识库或智能体的完整产品。模型的基础概念见大语言模型(LLM)指南;后续一代的架构和选型边界见Llama 4 Scout 与 Maverick 指南

Llama 3、3.1、3.2、3.3 有什么区别?

Meta 的官方 llama-models 模型表按发布日期、规模、上下文、tokenizer、许可和模型卡列出各代。选型时应以模型卡和下载清单为准,不从文件名、第三方页面或营销标题猜能力。

版本 官方规模 上下文 模态/定位 发布日期
Llama 3 8B、70B 8K 文本;原始第三代 2024-04-18
Llama 3.1 8B、70B、405B 128K 多语言文本、工具使用 2024-07-23
Llama 3.2 1B、3B 128K 轻量文本 2024-09-25
Llama 3.2-Vision 11B、90B 128K 图像与文本输入,文本输出 2024-09-25
Llama 3.3 70B 128K 多语言文本 2024-12-04

Llama 3.1 发布说明明确新增 405B、128K 上下文和八种明确支持语言;Llama 3.2 发布说明则将轻量文本模型与视觉模型带入家族。Llama 3.3 模型卡记录了 70B、128K 和多语言文本定位。

“版本更晚”不等于任何任务都更好。旧系统可能锁定原始 Llama 3 的 tokenizer、聊天模板或许可;边缘设备可能优先 3.2 轻量模型;视觉任务需要 3.2-Vision;新项目还应把 Llama 4 与其他模型纳入同一任务评测。版本选择必须服从实际质量、硬件、许可与维护要求。

Llama 3 的架构有哪些可确认事实?

原始模型卡把 Llama 3 描述为经过优化的自回归 decoder-only Transformer。它根据已有 token 预测后续 token;所谓“知识”来自权重中的统计模式,不是可查询的实时数据库。Transformer、自注意力与 KV 缓存的基础关系可参考Transformer 完整图解

组件 官方说明 部署影响
架构 decoder-only Transformer 按 token 自回归生成,延迟随输出长度累积
Tokenizer 128K 词表,基于 TikToken 的方案 提示长度应按对应 tokenizer 计数
注意力 8B 与 70B 均使用 GQA 减少 KV 相关开销,但不消除上下文成本
训练序列 8,192 token 原始模型不能当成 128K 版本使用
预训练数据 超过 15T token 的公开来源混合数据 规模不代表事实永远正确或最新
后训练 Instruct 使用 SFT 与 RLHF 更适合对话,但仍需任务评测与安全控制

旧稿把模型描述成从“接龙”进化到拥有独立思维,并用 GQA 直接推导出固定速度。这两种说法都不成立。GQA 是架构特征,实际吞吐还受权重精度、运行时、GPU/CPU、内存带宽、批量、上下文、并发和输出长度影响。

Base 与 Instruct 应该怎样选?

变体 面向任务 输入方式 主要风险
Pretrained / Base 继续预训练、领域适配、研究 原始续写或自建后训练格式 未经指令对齐,不应直接当聊天助手
Instruct 对话、问答、摘要、任务指令 必须使用匹配版本的聊天模板 模板错误会造成角色混乱或输出退化

Base 不是“能力更强的专业版”,Instruct 也不是“带知识库的版本”。Instruct 在基础权重上经过对话与偏好后训练,更容易遵循任务指令;Base 保留更原始的续写行为,适合作为进一步训练的起点。选择前要核对仓库中的模型 ID、tokenizer 与 prompt format,不能把其他版本的特殊 token 或聊天模板直接复制过来。

同一个 Instruct 模型在不同运行时中可能有不同默认 system prompt、停止 token 和采样参数。验收记录应保存最终渲染后的完整消息,而不是只保存用户看到的那一句提示。

模型权重、量化格式和运行时不是一回事

Llama 本地推理从模型版本权重格式运行时上下文解码到应用层控制的完整技术栈
图 2:任何一层变化,都可能改变速度、显存、质量或安全。
要锁定的内容 常见误区
模型 完整 ID、Base/Instruct、版本 只写“Llama 3 8B”
权重 来源、文件列表、哈希、精度 把第三方重打包当官方原件
量化 格式、算法、位宽与量化者 只写 Q4,不说明具体方案
运行时 名称、版本、后端和内核 把运行时性能说成模型固有性能
上下文 输入、输出上限、KV 精度 只按权重大小估显存
应用 提示、RAG、工具、并发与缓存 只测空载单请求就宣称可生产

Meta 的官方仓库下载说明提供模型列表、描述、下载和校验命令,并提示旧版本需要显式列出。社区常用的 GGUF、GPTQ、AWQ 等量化可能来自第三方转换;它们有实际价值,但必须核对来源、基础模型、聊天模板、转换参数、哈希与许可,不能因为文件名含“Llama”就默认可信。

怎样估算内存和显存?

权重存储的粗略下限可写成“参数量 × 每参数字节”,但运行时总占用还包括 KV cache、激活、临时工作区、运行时开销和并发副本。8B 的“4 bit 权重约 4 GB”只是数学上的权重位数近似,不是整套程序能在 4 GB 显存中稳定运行的承诺。

占用来源 主要受什么影响 怎样实测
模型权重 参数量、精度、量化元数据 记录加载后常驻内存/显存
KV cache 上下文、批量、并发、KV 精度 按目标最大长度与并发压测
激活/工作区 后端、算子、批量和图优化 观察峰值而非空载值
系统开销 驱动、容器、缓存、其他进程 预留安全余量并测试 OOM
CPU 卸载 分层策略、内存与总线带宽 同时测吞吐、首 token 和抖动

容量规划至少要在目标上下文、真实提示长度、预期并发和输出上限下测峰值。若只用一句短问题测 1 个请求,无法证明长文 RAG 或多用户服务不会 OOM。还要测试内存不足后的行为:拒绝、排队、缩短上下文、切换小模型还是进程崩溃。

部署方式怎样选择?

方式 适合 要验证
Meta 官方 PyTorch 参考实现 核对原始行为、研究和开发 依赖、权重完整性、prompt format
GPU 服务运行时 批量、并发、API 服务 模型兼容、调度、KV 管理和故障恢复
本地桌面/命令行工具 个人试用、小规模离线任务 量化来源、更新、数据存储和端口暴露
云托管 API 快速试验、不维护硬件 供应商实际模型 ID、数据政策、限流与价格
自建容器/集群 企业私有化与可控运维 镜像、驱动、监控、补丁、权限和回滚

“本地部署”只说明推理可以在自有设备执行,不自动等于数据零外传。桌面工具可能检查更新、拉取模型、记录遥测或开放局域网端口;RAG 组件、向量库和外部插件也可能访问网络。上线前应抓取实际网络连接、检查日志与缓存位置,并对模型文件和容器镜像做供应链校验。

中文场景能直接用原始 Llama 3 吗?

原始 Llama 3 模型卡把预期用途限定在英语,且明确把其他语言列为超出原始用途的情况;开发者可在遵守许可与使用政策的前提下做其他语言微调,但要自行负责安全和效果。Llama 3.1 虽明确支持八种语言,官方列出的八种并不包含中文,因此“支持多语言”也不能自动推导出中文已经通过官方生产验收。

中文测试切片 至少覆盖 指标
文字形态 简体、繁体、中英混输、全角符号 任务正确率、乱码与语言一致率
业务表达 口语、缩写、错别字、地区术语 误分类、遗漏和拒答率
事实问答 中文来源、时间敏感与冲突证据 引用覆盖与主张忠实度
结构化输出 中文字段值、日期、金额、单位 Schema 与业务规则通过率
安全 中文变体注入、敏感词和越权请求 攻击成功率与误拒绝率

中文 token 密度、输出长度和延迟应在真实文本上测,不能拿英文基准换算。若原始 Llama 3 不达标,应比较后续 Llama 版本、其他中文模型、领域微调或 RAG,而不是不断堆提示词后宣称已经“优化”。

什么时候用 RAG,什么时候微调?

问题 更合适的方案 原因
缺少最新、私有或可引用事实 RAG、数据库或 API 权重不是实时知识库
输出风格、标签或术语长期不稳 微调或专用分类器 需要跨请求固化行为
只需展示少数边界案例 Few-shot 不改权重且便于快速试验
需要付款、删除或查询真实状态 工具调用与权限系统 模型本身没有真实权限
高影响专业结论 证据链、规则与人工复核 生成模型不能承担最终责任

RAG 提供外部证据,不能自动修复模型的指令遵循;微调改变行为,也不能自动更新事实。两者可组合,但要分别验收检索质量、生成忠实度和模型行为。完整边界见RAG 原理与生产指南LoRA/QLoRA 与微调上线验收

Llama 3 的社区许可怎样理解?

Llama 3 权重可供广泛商业和研究使用,但不是“没有条件的公共领域资源”。原始Meta Llama 3 Community License是自定义社区许可,包含协议副本、展示“Built with Meta Llama 3”、Notice 归属、可接受使用政策以及特定大规模商业主体另行申请等条款。

场景 需要核对 不能假设
内部试验 下载来源、许可版本、可接受使用政策 内部使用就没有合规义务
对外提供产品 展示文案、协议、Notice、品牌要求 只在代码仓库放一个链接即可
再分发权重/衍生物 协议副本、归属、名称和分发文件 社区量化可以抹掉原始许可
用输出训练其他模型 具体版本的许可条文 所有 3.x 版本规则完全相同
超大规模主体 发布日期时的月活门槛与另行许可 普通商业许可自动覆盖所有主体

原始 Llama 3 许可限制使用材料或输出改进其他大语言模型(Llama 3 衍生物除外);Llama 3.1 Community License对输出训练/改进其他模型的规则发生变化。因而必须保存“具体模型版本—许可版本—产品用途”的映射,不能只做一份泛化的“Llama 已开源”审核。本节是工程核对清单,不构成法律意见;商业发布应由合格人员审阅原文和所在法域要求。

官方基准能否证明适合你的业务?

不能。模型卡中的基准是在特定数据、提示、评测脚本和精度下得到的结果,适合了解官方测试,不等于量化版、中文任务、RAG 系统或高并发服务的生产表现。旧稿把不同模型和不同测法拼成“接近 GPT-4”的单一结论,缺少可比性。

Llama 模型从任务风险版本基线离线回归负载故障到灰度回滚的上线门禁流程
图 3:官方基准只是一项输入,最终门禁来自自己的任务与运行环境。
门禁 建议证据 常见遗漏
任务质量 固定保留集、逐样本结果、错误类型 只展示几个成功对话
事实 主张—引用映射、无依据率 把流畅度当正确性
中文 真实中文分布与人工校准集 只跑英文公开榜单
量化 原始精度与候选量化同集对比 只比较 tokens/s
运行 首 token、P95、吞吐、峰值内存、错误率 只测空载单请求
安全 注入、越权、敏感信息、拒答测试 认为 Instruct 已经安全
回滚 权重、镜像、配置和数据版本 只能回滚代码,不能回滚模型

事实型任务应逐条检查来源,方法见AI 幻觉核验指南。若使用模型评分器,应先用人工校准集验证评分器,避免它偏好更长、更自信或与自己风格相似的答案。

性能测试应该怎样记录?

记录项 示例内容 缺失后的问题
模型身份 模型 ID、权重哈希、Base/Instruct 无法复现实际权重
精度/量化 BF16、FP16 或具体量化方案 质量与内存不可比较
运行环境 GPU/CPU、显存/内存、驱动、运行时版本 速度数字没有迁移意义
负载 输入/输出长度、批量、并发、请求分布 短提示成绩被外推到长文
指标定义 预填、生成、首 token、P50/P95、失败率 不同团队的 tokens/s 不是一回事
质量 同一保留集、解析结果、人工复核 加速以牺牲质量却未被发现

报告应附原始命令、配置和日志,并区分预热前后。社区结果可用于提出候选方案,不能替代本机复测。若某个配置只在一个短提示上最快,却在长上下文或并发下 OOM,它不是生产最佳配置。

已有 Llama 3 系统要不要迁移?

模型已经有后续版本,不代表原始 Llama 3 应立即下线。一个已经通过业务验收、风险较低、成本稳定的 8B 或 70B 服务,继续使用可能比追逐版本号更可靠;但如果它缺少所需语言、上下文、工具能力,或者权重与运行时已无法获得安全维护,就应启动迁移评估。

现状 建议 必须验证
固定英文分类任务,质量稳定 可暂时保留原始 Llama 3 依赖维护、安全补丁和长期可用性
需要超过 8K 的长文 比较 3.1/3.3、RAG 或分块方案 长上下文有效性、KV 成本与遗漏率
需要图像输入 比较 3.2-Vision 或其他视觉模型 图像任务集、OCR、隐私与模态注入
需要中文生产服务 对比后续 Llama 与中文模型 真实中文切片而非英文榜单
现有量化来源不明 先重建供应链与权重基线 来源、哈希、许可和恶意文件扫描
高风险工具动作 先补权限和审批,再考虑换模型 越权、注入、确认和回滚

迁移不能只替换模型文件。不同版本可能使用不同聊天模板、系统提示、工具格式、停止 token、默认上下文和安全行为;同名字段也可能有不同语义。应建立双轨环境,让旧版与候选版处理同一批脱敏请求,比较逐样本输出、解析失败、拒答、引用、延迟和成本,再按流量灰度。

如果候选模型总体分更高,但高影响类别更差,不能直接切换。先定义每类不可退化指标与回滚阈值;灰度阶段把模型 ID、提示版本和运行时写进请求日志,使每个投诉都能还原。确认迁移后,也应保留旧权重、镜像和配置一段可审计窗口,而不是只保留新服务。

模型知识截止与“最新回答”怎样处理?

原始模型卡记录了离线训练与数据新鲜度边界:8B 和 70B 的知识截止分别落在 2023 年。知识截止不是一条绝对分界线,也不能保证此前事实全部正确;它只是提醒开发者不要把权重当成实时来源。2024 年之后的法规、产品、价格、人员和事件尤其需要外部证据。

应用应把事实更新与模型版本解耦:检索系统负责返回有权限、带日期和来源的材料;模型负责按任务契约整理;校验器检查引用是否支持主张;证据不足时明确拒答或转人工。这样不必为每次资料变化重新训练模型,也不会因为换了更晚模型就误以为所有答案自动最新。

安全、隐私和供应链要检查什么?

Meta 的 Llama 3 责任说明和模型卡都指出测试无法覆盖所有场景,并建议针对应用做安全评估。模型本地运行不会自动解决提示注入、敏感数据进入日志、恶意模型文件、越权工具调用或不安全输出等系统问题。

  • 只从已批准来源下载,保存许可证、文件清单、哈希和扫描结果。
  • 模型加载进程使用最小权限,不让未知代码或插件直接访问生产凭据。
  • 用户数据、检索文档、提示和输出按敏感等级记录与保留,避免全量日志泄露。
  • 工具调用由确定性权限系统批准;付款、删除、改权限等动作需要确认与回滚。
  • 对中文和编码变体做注入、绕过与误拒绝测试,不能只复用英文安全集。
  • 模型、运行时、容器与依赖升级都进入变更流程,并能回到已验收版本。

常见故障怎样排查?

症状 优先检查 处理方向
回答出现角色标记或循环 聊天模板、特殊 token、停止条件 使用对应版本 prompt format
长输入突然失败 模型真实上下文、token 计数、KV 占用 缩短、检索、分块或换长上下文版本
量化后质量下降 基础模型、量化方法、任务切片 换量化或提高精度,做逐样本回归
显存足够仍 OOM 批量、并发、KV、工作区和碎片 降低并发/长度并调度资源
中文答非所问 语言适用范围、提示、领域数据 换模型、Few-shot、RAG 或微调
单请求快、并发崩溃 排队、批处理、KV 管理、超时 做目标负载压测和背压

生产上线清单

  1. 完整记录 Llama 版本、参数规模、Base/Instruct、权重来源和哈希。
  2. 核对该版本模型卡、Community License、Acceptable Use Policy 与归属要求。
  3. 聊天模板、tokenizer、停止 token 与模型版本匹配。
  4. 量化候选和原始精度在同一中文保留集上做质量回归。
  5. 按目标上下文、输出长度、并发和故障场景测内存、延迟与吞吐。
  6. 事实问答有检索来源、引用校验和证据不足路径。
  7. 工具动作由权限、审批、沙箱与回滚控制,不由模型文本直接授权。
  8. 模型、镜像、提示、检索索引和解析器都有版本与回滚方案。

常见问题

Llama 3 是真正的开源软件许可证吗?

它以可下载权重和代码广泛开放,但模型材料使用的是 Meta 自定义 Community License,并含归属、使用政策和额外商业条款。工程和法务文档最好写“开放权重/社区许可”,并以具体版本原文为准。

Llama 3 8B 能在消费级电脑运行吗?

社区量化和 CPU/GPU 运行时使本地运行成为可能,但能否满足你的设备与速度要求取决于量化、内存带宽、上下文、并发和运行时。不要只按权重文件大小下结论,应在目标机器复测。

原始 Llama 3 支持 128K 吗?

不支持。官方原始 Llama 3 为 8K;128K 从 Llama 3.1 开始。第三方扩展或修改不能改写官方原始规格,使用时要单独标明来源和方法。

Llama 3 适合中文知识库吗?

可以作为候选,但原始模型卡的预期语言是英语,不能跳过中文评测。知识库还需要独立验收检索召回、引用忠实度、拒答、安全与运行成本。

编辑复核与纠错记录

本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿把 Llama 3.1 的 405B/128K、Llama 3.2 的端侧/视觉能力混入原始 Llama 3,并含无完整环境的显卡速度、显存与竞品“实测”结论;新版依据 Meta 官方发布、模型卡、模型仓库和许可原文重建版本矩阵、架构、Base/Instruct、权重与量化、中文适用范围、资源估算和上线门禁。本站的来源、更新与纠错原则见关于本站与编辑规范