Meta最新开源推出的新一代大模型
Llama 3 是什么
Llama 3 是 Meta 于 2024 年 4 月 18 日发布的第三代开源大语言模型家族,初始放出 8B、70B 两个稠密文本模型;随后在 2024 年下半年快速迭代出 Llama 3.1(加 405B 旗舰、128K 上下文、8 语)、Llama 3.2(1B/3B 端侧 + 11B/90B 视觉)、Llama 3.3(70B 指令版逼近 405B),形成从手机端到数据中心的全频谱开放权重矩阵。Llama 3 系列基于 decoder-only Transformer,采用 128K token 分词器、全系 GQA、15T+ token 训练语料,是首个在 405B 尺度上对标 GPT-4o / Claude 3.5 Sonnet 的开放权重(open-weight)基础模型,开发者可自托管、微调、蒸馏,不绑定 Meta API。
Llama 3 家族型号(2026 现行版)
| 版本 | 参数 | 上下文 | 模态 | 定位 |
|---|---|---|---|---|
| Llama 3(初代) | 8B / 70B | 8K(训练态) | 文本 | 2024-04 首发,基础第三代 |
| Llama 3.1 | 8B / 70B / 405B | 128K | 文本 | 2024-07,首开 405B 旗舰+工具调用+8 语 |
| Llama 3.2 | 1B / 3B | 128K | 文本 | 端侧/移动,量化后 1–3GB 可跑 |
| Llama 3.2 Vision | 11B / 90B | 128K | 图文输入→文本 | 2024-09,接视觉适配器 |
| Llama 3.3 | 70B(仅 Instruct) | 128K | 文本 | 2024-12,70B 档首选,替代 3.1-70B |
选型速记:1B/3B 用 3.2;8B 用 3.1;视觉用 3.2-11B/90B;70B 用 3.3;要旗舰用 3.1-405B(或走云 API)。
主要能力与改进
架构与推理
- Decoder-only Transformer,RoPE θ=500K,全系 GQA(8B 也带,显存占用大幅下降)。
- 分词器词表 128,256(tiktoken-style BPE),比 Llama 2 的 32K 翻 4 倍,中英代码压缩率更高。
- 初代训练上下文 8K,3.1+ 统一扩展到 128K token 推理。
训练数据
- 初代 8B/70B:15T+ token(Llama 2 的 ~7 倍),代码数据 4× 扩容,含 30+ 语言非英语数据(>5%)。
- 3.1 起明确支持 英/德/法/意/葡/西/泰/印地 8 种语言高质量对齐。
对齐与安全
- 指令版走 SFT + RLHF/DPO,错误拒绝率下降、指令跟随提升。
- 安全套件:Llama Guard 2 → Llama Guard 3、Prompt Guard、Code Shield、CyberSec Eval 2。
工具与智能体
- 3.1 起原生支持 function calling / tool use / 结构化输出,可接搜索、代码解释器、DB。
- Llama Stack 提供 Agent 编排参考实现,官方推合成数据生成与模型蒸馏工作流。
多模态延伸
- 3.2 Vision 11B(~8GB VRAM 可跑)/ 90B 支持图像理解、图表读取、视觉问答。
性能定位(官方基准)
- Llama 3 8B(初代):MMLU ~66.6,持平/超 Llama 2 70B,同尺寸优于 Gemma 7B、Mistral 7B。
- Llama 3.1 405B:MMLU 88.6、GPQA 61.6,发布时与 GPT-4o、Claude 3.5 Sonnet 同档。
- Llama 3.3 70B:MATH 较 3.1-70B +9.2,IFEval 92.1(超 405B),MGSM 多语 +4.2,文本任务逼近 3.1-405B 但成本低一个数量级。
如何使用 Llama 3
开发者自托管 / 微调
- 权重下载:https://llama.meta.com/llama-downloads (需同意 Llama 3 Community License)
- GitHub:https://github.com/meta-llama/llama3
- Hugging Face 集合:https://huggingface.co/collections/meta-llama/meta-llama-3-66214712577ca38149ebb2b6
- 本地运行:Ollama(
ollama pull llama3.3/llama3.1:8b)、llama.cpp、vLLM、TGI - 微调:torchtune(Meta 官方)、PEFT/LoRA/QLoRA、Axolotl
- 云推理:AWS Bedrock、Azure AI、GCP Vertex、Groq、Replicate(https://replicate.com/meta )、Fireworks、Together
普通用户免部署体验
- Meta AI(meta.ai / WhatsApp 内):部分地区可用,不再严格锁区,切到 Llama 3.1 405B 或 3.3
- HuggingChat:https://huggingface.co/chat (可切 Llama-3.3-70B-Instruct)
- Replicate 在线 Demo:https://llama3.replicate.dev/
- 本地轻量:Ollama + 3.2-3B 在笔记本跑
关键信息与许可
- 许可:Llama 3 Community License(研究+商用,月活 >7 亿产品需向 Meta 报备);3.1 起允许用模型输出蒸馏/改进其他模型。
- 权重性质:open-weight(开放权重),非完全开源代码训练全流程;可离线、可私有化。
- 硬件参考:8B Q4 ~5GB 内存可跑;70B BF16 需 ~140GB 显存(多卡),Q4 量化 ~40GB;405B 需多张 H100,FP8 量化可减半卡数。
- 上下文:3.1+ 全系 128K;初代 8K 仅训练态,经 RoPE 扩展可推到 128K。
- 现状(2026-07):Llama 3.x 仍是 Meta 主推开放权重线;Llama 4(Scout/Maverick,MoE)已接棒旗舰,但 3.3 70B 因性价比仍是生产部署最常用选择之一。
核心优势
- 开放权重+可私有化:数据不出域,金融/医疗/政企合规场景首选。
- 尺寸光谱完整:1B 跑手机,405B 拼闭源旗舰,中间每档都有对应版本。
- 生态最成熟:Ollama、vLLM、LangChain、LlamaIndex、torchtune、各云厂首日支持。
- 405B 开启开源旗舰时代:首次让开源界拿到 GPT-4 级基座做蒸馏/合成数据。
- 3.3 70B 性价比王:单卡 A100/H100 可服务,质量接近 405B,推理成本 1/5。
同类竞品对比
| 维度 | Llama 3.x(3.3/3.1) | Qwen3 / Qwen2.5 | Mistral / Mixtral | Claude / GPT(闭源) |
|---|---|---|---|---|
| 权重开放 | ✅ open-weight | ✅ 部分开放 | ✅ 7B/8x7B 开放 | ❌ API only |
| 最大尺度 | 405B(3.1) | 110B+ | 8x22B MoE | 未公开 |
| 上下文 | 128K | 128K–1M | 32K–128K | 200K+ |
| 多模态 | 3.2-Vision 11B/90B | VL 版本齐全 | 有限 | 原生多模 |
| 端侧小模型 | 1B/3B | 0.5B–3B | — | — |
| 中文能力 | 中上(需微调更优) | 强 | 一般 | 强 |
| 商用门槛 | 月活>7亿报备 | 宽松 | 宽松 | 按 token 付费 |
| 自托管成本 | 低(可量化) | 低 | 低 | 不适用 |
应用场景
- 私有化知识库 / 企业助理:3.3-70B 量化部署内网,接 RAG 不走公网。
- 端侧 App:3.2-1B/3B 跑手机摘要、日程提取、本地翻译。
- 代码助手:3.1-8B 本地补全,405B 做复杂重构评审。
- 多语客服:3.1 八语对齐,做跨语言工单分类与回复草稿。
- 合成数据与蒸馏:用 405B 产 SFT 数据,蒸馏到 8B 做线上轻量模型。
- 视觉文档抽取:3.2-90B Vision 读扫描合同、报表、白板图。
- 科研复现:开放权重可复现实验、做探针分析、改架构 ablation。
