直接回答:Llama 3 是 Meta 于 2024 年 4 月 18 日发布的一组文本大语言模型,原始版本包含 8B 和 70B 两种参数规模,各有预训练版与指令微调版,上下文长度为 8K。它采用 decoder-only Transformer、128K 词表的 tokenizer,并在两个规模上使用 GQA(Grouped-Query Attention)以提高推理效率。
需要特别区分:405B、128K 上下文和官方多语言支持属于 Llama 3.1;1B/3B 端侧文本模型与 11B/90B 视觉模型属于 Llama 3.2;Llama 3.3 是 70B 文本模型。它们都属于 3.x 家族,但不是原始 Llama 3 的规格。2026 年选型时,应写完整模型 ID 和版本,不能只写“Llama 3”。

Llama 3 是什么?官方规格是什么?
Meta 的 Llama 3 发布说明和官方模型卡记录了原始版本边界:8B/70B、文本输入与文本/代码输出、8,192 训练序列长度、预训练与指令微调两类权重。模型卡把原始 Llama 3 的预期用途写为英语商业和研究场景,并要求开发者为自身应用做安全测试。
| 项目 | 原始 Llama 3 | 容易混淆的说法 |
|---|---|---|
| 发布日期 | 2024-04-18 | 把整个 3.x 家族都称为同日发布 |
| 参数规模 | 8B、70B | 405B 属于 Llama 3.1 |
| 上下文 | 8K | 128K 属于后续 3.1/3.2/3.3 |
| 模态 | 文本输入,文本与代码输出 | 视觉模型属于 Llama 3.2-Vision |
| 变体 | Pretrained、Instruct | 社区量化不是 Meta 新模型版本 |
| 主要官方用途 | 英语商业与研究;Instruct 面向对话 | 不能据此保证中文生产质量 |
Llama 3 是大语言模型的一个具体家族,不是聊天应用、知识库或智能体的完整产品。模型的基础概念见大语言模型(LLM)指南;后续一代的架构和选型边界见Llama 4 Scout 与 Maverick 指南。
Llama 3、3.1、3.2、3.3 有什么区别?
Meta 的官方 llama-models 模型表按发布日期、规模、上下文、tokenizer、许可和模型卡列出各代。选型时应以模型卡和下载清单为准,不从文件名、第三方页面或营销标题猜能力。
| 版本 | 官方规模 | 上下文 | 模态/定位 | 发布日期 |
|---|---|---|---|---|
| Llama 3 | 8B、70B | 8K | 文本;原始第三代 | 2024-04-18 |
| Llama 3.1 | 8B、70B、405B | 128K | 多语言文本、工具使用 | 2024-07-23 |
| Llama 3.2 | 1B、3B | 128K | 轻量文本 | 2024-09-25 |
| Llama 3.2-Vision | 11B、90B | 128K | 图像与文本输入,文本输出 | 2024-09-25 |
| Llama 3.3 | 70B | 128K | 多语言文本 | 2024-12-04 |
Llama 3.1 发布说明明确新增 405B、128K 上下文和八种明确支持语言;Llama 3.2 发布说明则将轻量文本模型与视觉模型带入家族。Llama 3.3 模型卡记录了 70B、128K 和多语言文本定位。
“版本更晚”不等于任何任务都更好。旧系统可能锁定原始 Llama 3 的 tokenizer、聊天模板或许可;边缘设备可能优先 3.2 轻量模型;视觉任务需要 3.2-Vision;新项目还应把 Llama 4 与其他模型纳入同一任务评测。版本选择必须服从实际质量、硬件、许可与维护要求。
Llama 3 的架构有哪些可确认事实?
原始模型卡把 Llama 3 描述为经过优化的自回归 decoder-only Transformer。它根据已有 token 预测后续 token;所谓“知识”来自权重中的统计模式,不是可查询的实时数据库。Transformer、自注意力与 KV 缓存的基础关系可参考Transformer 完整图解。
| 组件 | 官方说明 | 部署影响 |
|---|---|---|
| 架构 | decoder-only Transformer | 按 token 自回归生成,延迟随输出长度累积 |
| Tokenizer | 128K 词表,基于 TikToken 的方案 | 提示长度应按对应 tokenizer 计数 |
| 注意力 | 8B 与 70B 均使用 GQA | 减少 KV 相关开销,但不消除上下文成本 |
| 训练序列 | 8,192 token | 原始模型不能当成 128K 版本使用 |
| 预训练数据 | 超过 15T token 的公开来源混合数据 | 规模不代表事实永远正确或最新 |
| 后训练 | Instruct 使用 SFT 与 RLHF | 更适合对话,但仍需任务评测与安全控制 |
旧稿把模型描述成从“接龙”进化到拥有独立思维,并用 GQA 直接推导出固定速度。这两种说法都不成立。GQA 是架构特征,实际吞吐还受权重精度、运行时、GPU/CPU、内存带宽、批量、上下文、并发和输出长度影响。
Base 与 Instruct 应该怎样选?
| 变体 | 面向任务 | 输入方式 | 主要风险 |
|---|---|---|---|
| Pretrained / Base | 继续预训练、领域适配、研究 | 原始续写或自建后训练格式 | 未经指令对齐,不应直接当聊天助手 |
| Instruct | 对话、问答、摘要、任务指令 | 必须使用匹配版本的聊天模板 | 模板错误会造成角色混乱或输出退化 |
Base 不是“能力更强的专业版”,Instruct 也不是“带知识库的版本”。Instruct 在基础权重上经过对话与偏好后训练,更容易遵循任务指令;Base 保留更原始的续写行为,适合作为进一步训练的起点。选择前要核对仓库中的模型 ID、tokenizer 与 prompt format,不能把其他版本的特殊 token 或聊天模板直接复制过来。
同一个 Instruct 模型在不同运行时中可能有不同默认 system prompt、停止 token 和采样参数。验收记录应保存最终渲染后的完整消息,而不是只保存用户看到的那一句提示。
模型权重、量化格式和运行时不是一回事

| 层 | 要锁定的内容 | 常见误区 |
|---|---|---|
| 模型 | 完整 ID、Base/Instruct、版本 | 只写“Llama 3 8B” |
| 权重 | 来源、文件列表、哈希、精度 | 把第三方重打包当官方原件 |
| 量化 | 格式、算法、位宽与量化者 | 只写 Q4,不说明具体方案 |
| 运行时 | 名称、版本、后端和内核 | 把运行时性能说成模型固有性能 |
| 上下文 | 输入、输出上限、KV 精度 | 只按权重大小估显存 |
| 应用 | 提示、RAG、工具、并发与缓存 | 只测空载单请求就宣称可生产 |
Meta 的官方仓库下载说明提供模型列表、描述、下载和校验命令,并提示旧版本需要显式列出。社区常用的 GGUF、GPTQ、AWQ 等量化可能来自第三方转换;它们有实际价值,但必须核对来源、基础模型、聊天模板、转换参数、哈希与许可,不能因为文件名含“Llama”就默认可信。
怎样估算内存和显存?
权重存储的粗略下限可写成“参数量 × 每参数字节”,但运行时总占用还包括 KV cache、激活、临时工作区、运行时开销和并发副本。8B 的“4 bit 权重约 4 GB”只是数学上的权重位数近似,不是整套程序能在 4 GB 显存中稳定运行的承诺。
| 占用来源 | 主要受什么影响 | 怎样实测 |
|---|---|---|
| 模型权重 | 参数量、精度、量化元数据 | 记录加载后常驻内存/显存 |
| KV cache | 上下文、批量、并发、KV 精度 | 按目标最大长度与并发压测 |
| 激活/工作区 | 后端、算子、批量和图优化 | 观察峰值而非空载值 |
| 系统开销 | 驱动、容器、缓存、其他进程 | 预留安全余量并测试 OOM |
| CPU 卸载 | 分层策略、内存与总线带宽 | 同时测吞吐、首 token 和抖动 |
容量规划至少要在目标上下文、真实提示长度、预期并发和输出上限下测峰值。若只用一句短问题测 1 个请求,无法证明长文 RAG 或多用户服务不会 OOM。还要测试内存不足后的行为:拒绝、排队、缩短上下文、切换小模型还是进程崩溃。
部署方式怎样选择?
| 方式 | 适合 | 要验证 |
|---|---|---|
| Meta 官方 PyTorch 参考实现 | 核对原始行为、研究和开发 | 依赖、权重完整性、prompt format |
| GPU 服务运行时 | 批量、并发、API 服务 | 模型兼容、调度、KV 管理和故障恢复 |
| 本地桌面/命令行工具 | 个人试用、小规模离线任务 | 量化来源、更新、数据存储和端口暴露 |
| 云托管 API | 快速试验、不维护硬件 | 供应商实际模型 ID、数据政策、限流与价格 |
| 自建容器/集群 | 企业私有化与可控运维 | 镜像、驱动、监控、补丁、权限和回滚 |
“本地部署”只说明推理可以在自有设备执行,不自动等于数据零外传。桌面工具可能检查更新、拉取模型、记录遥测或开放局域网端口;RAG 组件、向量库和外部插件也可能访问网络。上线前应抓取实际网络连接、检查日志与缓存位置,并对模型文件和容器镜像做供应链校验。
中文场景能直接用原始 Llama 3 吗?
原始 Llama 3 模型卡把预期用途限定在英语,且明确把其他语言列为超出原始用途的情况;开发者可在遵守许可与使用政策的前提下做其他语言微调,但要自行负责安全和效果。Llama 3.1 虽明确支持八种语言,官方列出的八种并不包含中文,因此“支持多语言”也不能自动推导出中文已经通过官方生产验收。
| 中文测试切片 | 至少覆盖 | 指标 |
|---|---|---|
| 文字形态 | 简体、繁体、中英混输、全角符号 | 任务正确率、乱码与语言一致率 |
| 业务表达 | 口语、缩写、错别字、地区术语 | 误分类、遗漏和拒答率 |
| 事实问答 | 中文来源、时间敏感与冲突证据 | 引用覆盖与主张忠实度 |
| 结构化输出 | 中文字段值、日期、金额、单位 | Schema 与业务规则通过率 |
| 安全 | 中文变体注入、敏感词和越权请求 | 攻击成功率与误拒绝率 |
中文 token 密度、输出长度和延迟应在真实文本上测,不能拿英文基准换算。若原始 Llama 3 不达标,应比较后续 Llama 版本、其他中文模型、领域微调或 RAG,而不是不断堆提示词后宣称已经“优化”。
什么时候用 RAG,什么时候微调?
| 问题 | 更合适的方案 | 原因 |
|---|---|---|
| 缺少最新、私有或可引用事实 | RAG、数据库或 API | 权重不是实时知识库 |
| 输出风格、标签或术语长期不稳 | 微调或专用分类器 | 需要跨请求固化行为 |
| 只需展示少数边界案例 | Few-shot | 不改权重且便于快速试验 |
| 需要付款、删除或查询真实状态 | 工具调用与权限系统 | 模型本身没有真实权限 |
| 高影响专业结论 | 证据链、规则与人工复核 | 生成模型不能承担最终责任 |
RAG 提供外部证据,不能自动修复模型的指令遵循;微调改变行为,也不能自动更新事实。两者可组合,但要分别验收检索质量、生成忠实度和模型行为。完整边界见RAG 原理与生产指南和LoRA/QLoRA 与微调上线验收。
Llama 3 的社区许可怎样理解?
Llama 3 权重可供广泛商业和研究使用,但不是“没有条件的公共领域资源”。原始Meta Llama 3 Community License是自定义社区许可,包含协议副本、展示“Built with Meta Llama 3”、Notice 归属、可接受使用政策以及特定大规模商业主体另行申请等条款。
| 场景 | 需要核对 | 不能假设 |
|---|---|---|
| 内部试验 | 下载来源、许可版本、可接受使用政策 | 内部使用就没有合规义务 |
| 对外提供产品 | 展示文案、协议、Notice、品牌要求 | 只在代码仓库放一个链接即可 |
| 再分发权重/衍生物 | 协议副本、归属、名称和分发文件 | 社区量化可以抹掉原始许可 |
| 用输出训练其他模型 | 具体版本的许可条文 | 所有 3.x 版本规则完全相同 |
| 超大规模主体 | 发布日期时的月活门槛与另行许可 | 普通商业许可自动覆盖所有主体 |
原始 Llama 3 许可限制使用材料或输出改进其他大语言模型(Llama 3 衍生物除外);Llama 3.1 Community License对输出训练/改进其他模型的规则发生变化。因而必须保存“具体模型版本—许可版本—产品用途”的映射,不能只做一份泛化的“Llama 已开源”审核。本节是工程核对清单,不构成法律意见;商业发布应由合格人员审阅原文和所在法域要求。
官方基准能否证明适合你的业务?
不能。模型卡中的基准是在特定数据、提示、评测脚本和精度下得到的结果,适合了解官方测试,不等于量化版、中文任务、RAG 系统或高并发服务的生产表现。旧稿把不同模型和不同测法拼成“接近 GPT-4”的单一结论,缺少可比性。

| 门禁 | 建议证据 | 常见遗漏 |
|---|---|---|
| 任务质量 | 固定保留集、逐样本结果、错误类型 | 只展示几个成功对话 |
| 事实 | 主张—引用映射、无依据率 | 把流畅度当正确性 |
| 中文 | 真实中文分布与人工校准集 | 只跑英文公开榜单 |
| 量化 | 原始精度与候选量化同集对比 | 只比较 tokens/s |
| 运行 | 首 token、P95、吞吐、峰值内存、错误率 | 只测空载单请求 |
| 安全 | 注入、越权、敏感信息、拒答测试 | 认为 Instruct 已经安全 |
| 回滚 | 权重、镜像、配置和数据版本 | 只能回滚代码,不能回滚模型 |
事实型任务应逐条检查来源,方法见AI 幻觉核验指南。若使用模型评分器,应先用人工校准集验证评分器,避免它偏好更长、更自信或与自己风格相似的答案。
性能测试应该怎样记录?
| 记录项 | 示例内容 | 缺失后的问题 |
|---|---|---|
| 模型身份 | 模型 ID、权重哈希、Base/Instruct | 无法复现实际权重 |
| 精度/量化 | BF16、FP16 或具体量化方案 | 质量与内存不可比较 |
| 运行环境 | GPU/CPU、显存/内存、驱动、运行时版本 | 速度数字没有迁移意义 |
| 负载 | 输入/输出长度、批量、并发、请求分布 | 短提示成绩被外推到长文 |
| 指标定义 | 预填、生成、首 token、P50/P95、失败率 | 不同团队的 tokens/s 不是一回事 |
| 质量 | 同一保留集、解析结果、人工复核 | 加速以牺牲质量却未被发现 |
报告应附原始命令、配置和日志,并区分预热前后。社区结果可用于提出候选方案,不能替代本机复测。若某个配置只在一个短提示上最快,却在长上下文或并发下 OOM,它不是生产最佳配置。
已有 Llama 3 系统要不要迁移?
模型已经有后续版本,不代表原始 Llama 3 应立即下线。一个已经通过业务验收、风险较低、成本稳定的 8B 或 70B 服务,继续使用可能比追逐版本号更可靠;但如果它缺少所需语言、上下文、工具能力,或者权重与运行时已无法获得安全维护,就应启动迁移评估。
| 现状 | 建议 | 必须验证 |
|---|---|---|
| 固定英文分类任务,质量稳定 | 可暂时保留原始 Llama 3 | 依赖维护、安全补丁和长期可用性 |
| 需要超过 8K 的长文 | 比较 3.1/3.3、RAG 或分块方案 | 长上下文有效性、KV 成本与遗漏率 |
| 需要图像输入 | 比较 3.2-Vision 或其他视觉模型 | 图像任务集、OCR、隐私与模态注入 |
| 需要中文生产服务 | 对比后续 Llama 与中文模型 | 真实中文切片而非英文榜单 |
| 现有量化来源不明 | 先重建供应链与权重基线 | 来源、哈希、许可和恶意文件扫描 |
| 高风险工具动作 | 先补权限和审批,再考虑换模型 | 越权、注入、确认和回滚 |
迁移不能只替换模型文件。不同版本可能使用不同聊天模板、系统提示、工具格式、停止 token、默认上下文和安全行为;同名字段也可能有不同语义。应建立双轨环境,让旧版与候选版处理同一批脱敏请求,比较逐样本输出、解析失败、拒答、引用、延迟和成本,再按流量灰度。
如果候选模型总体分更高,但高影响类别更差,不能直接切换。先定义每类不可退化指标与回滚阈值;灰度阶段把模型 ID、提示版本和运行时写进请求日志,使每个投诉都能还原。确认迁移后,也应保留旧权重、镜像和配置一段可审计窗口,而不是只保留新服务。
模型知识截止与“最新回答”怎样处理?
原始模型卡记录了离线训练与数据新鲜度边界:8B 和 70B 的知识截止分别落在 2023 年。知识截止不是一条绝对分界线,也不能保证此前事实全部正确;它只是提醒开发者不要把权重当成实时来源。2024 年之后的法规、产品、价格、人员和事件尤其需要外部证据。
应用应把事实更新与模型版本解耦:检索系统负责返回有权限、带日期和来源的材料;模型负责按任务契约整理;校验器检查引用是否支持主张;证据不足时明确拒答或转人工。这样不必为每次资料变化重新训练模型,也不会因为换了更晚模型就误以为所有答案自动最新。
安全、隐私和供应链要检查什么?
Meta 的 Llama 3 责任说明和模型卡都指出测试无法覆盖所有场景,并建议针对应用做安全评估。模型本地运行不会自动解决提示注入、敏感数据进入日志、恶意模型文件、越权工具调用或不安全输出等系统问题。
- 只从已批准来源下载,保存许可证、文件清单、哈希和扫描结果。
- 模型加载进程使用最小权限,不让未知代码或插件直接访问生产凭据。
- 用户数据、检索文档、提示和输出按敏感等级记录与保留,避免全量日志泄露。
- 工具调用由确定性权限系统批准;付款、删除、改权限等动作需要确认与回滚。
- 对中文和编码变体做注入、绕过与误拒绝测试,不能只复用英文安全集。
- 模型、运行时、容器与依赖升级都进入变更流程,并能回到已验收版本。
常见故障怎样排查?
| 症状 | 优先检查 | 处理方向 |
|---|---|---|
| 回答出现角色标记或循环 | 聊天模板、特殊 token、停止条件 | 使用对应版本 prompt format |
| 长输入突然失败 | 模型真实上下文、token 计数、KV 占用 | 缩短、检索、分块或换长上下文版本 |
| 量化后质量下降 | 基础模型、量化方法、任务切片 | 换量化或提高精度,做逐样本回归 |
| 显存足够仍 OOM | 批量、并发、KV、工作区和碎片 | 降低并发/长度并调度资源 |
| 中文答非所问 | 语言适用范围、提示、领域数据 | 换模型、Few-shot、RAG 或微调 |
| 单请求快、并发崩溃 | 排队、批处理、KV 管理、超时 | 做目标负载压测和背压 |
生产上线清单
- 完整记录 Llama 版本、参数规模、Base/Instruct、权重来源和哈希。
- 核对该版本模型卡、Community License、Acceptable Use Policy 与归属要求。
- 聊天模板、tokenizer、停止 token 与模型版本匹配。
- 量化候选和原始精度在同一中文保留集上做质量回归。
- 按目标上下文、输出长度、并发和故障场景测内存、延迟与吞吐。
- 事实问答有检索来源、引用校验和证据不足路径。
- 工具动作由权限、审批、沙箱与回滚控制,不由模型文本直接授权。
- 模型、镜像、提示、检索索引和解析器都有版本与回滚方案。
常见问题
Llama 3 是真正的开源软件许可证吗?
它以可下载权重和代码广泛开放,但模型材料使用的是 Meta 自定义 Community License,并含归属、使用政策和额外商业条款。工程和法务文档最好写“开放权重/社区许可”,并以具体版本原文为准。
Llama 3 8B 能在消费级电脑运行吗?
社区量化和 CPU/GPU 运行时使本地运行成为可能,但能否满足你的设备与速度要求取决于量化、内存带宽、上下文、并发和运行时。不要只按权重文件大小下结论,应在目标机器复测。
原始 Llama 3 支持 128K 吗?
不支持。官方原始 Llama 3 为 8K;128K 从 Llama 3.1 开始。第三方扩展或修改不能改写官方原始规格,使用时要单独标明来源和方法。
Llama 3 适合中文知识库吗?
可以作为候选,但原始模型卡的预期语言是英语,不能跳过中文评测。知识库还需要独立验收检索召回、引用忠实度、拒答、安全与运行成本。
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿把 Llama 3.1 的 405B/128K、Llama 3.2 的端侧/视觉能力混入原始 Llama 3,并含无完整环境的显卡速度、显存与竞品“实测”结论;新版依据 Meta 官方发布、模型卡、模型仓库和许可原文重建版本矩阵、架构、Base/Instruct、权重与量化、中文适用范围、资源估算和上线门禁。本站的来源、更新与纠错原则见关于本站与编辑规范。
