### [Llama 3](https://s.ddm.chat/kecheng/805.1) **Published:** 2026-07-24T08:12:42 **Author:** 颠倒梦 **Excerpt:** Meta最新开源推出的新一代大模型 Llama 3 是什么 Llama 3 是 Meta 于 2024 年 4 月 18 日发布的第三代开源大语言模型家族,初始放出 8B、70B​ 两个稠密文本模型;随后在 2024 年下半年快速迭代出 L Meta最新开源推出的新一代大模型 ## Llama 3 是什么 Llama 3 是 Meta 于 **2024 年 4 月 18 日**发布的第三代开源大语言模型家族,初始放出 **8B、70B**​ 两个稠密文本模型;随后在 2024 年下半年快速迭代出 **Llama 3.1(加 405B 旗舰、128K 上下文、8 语)、Llama 3.2(1B/3B 端侧 + 11B/90B 视觉)、Llama 3.3(70B 指令版逼近 405B)**,形成从手机端到数据中心的全频谱开放权重矩阵。Llama 3 系列基于 decoder-only Transformer,采用 128K token 分词器、全系 GQA、15T+ token 训练语料,是首个在 405B 尺度上对标 GPT-4o / Claude 3.5 Sonnet 的**开放权重(open-weight)基础模型**,开发者可自托管、微调、蒸馏,不绑定 Meta API。 * * * ## Llama 3 家族型号(2026 现行版) | 版本 | 参数 | 上下文 | 模态 | 定位 | | --- | --- | --- | --- | --- | | **Llama 3(初代)**​ | 8B / 70B | 8K(训练态) | 文本 | 2024-04 首发,基础第三代 | | **Llama 3.1**​ | 8B / 70B / **405B**​ | **128K**​ | 文本 | 2024-07,首开 405B 旗舰+工具调用+8 语 | | **Llama 3.2**​ | 1B / 3B | 128K | 文本 | 端侧/移动,量化后 1–3GB 可跑 | | **Llama 3.2 Vision**​ | 11B / 90B | 128K | 图文输入→文本 | 2024-09,接视觉适配器 | | **Llama 3.3**​ | 70B(仅 Instruct) | 128K | 文本 | 2024-12,**70B 档首选**,替代 3.1-70B | **选型速记**:1B/3B 用 3.2;8B 用 3.1;视觉用 3.2-11B/90B;70B 用 **3.3**;要旗舰用 3.1-405B(或走云 API)。 * * * ## 主要能力与改进 **架构与推理** - Decoder-only Transformer,RoPE θ=500K,全系 **GQA**(8B 也带,显存占用大幅下降)。 - 分词器词表 **128,256**(tiktoken-style BPE),比 Llama 2 的 32K 翻 4 倍,中英代码压缩率更高。 - 初代训练上下文 8K,3.1+ 统一扩展到 **128K**​ token 推理。 **训练数据** - 初代 8B/70B:**15T+ token**(Llama 2 的 ~7 倍),代码数据 4× 扩容,含 30+ 语言非英语数据(>5%)。 - 3.1 起明确支持 **英/德/法/意/葡/西/泰/印地**​ 8 种语言高质量对齐。 **对齐与安全** - 指令版走 SFT + RLHF/DPO,错误拒绝率下降、指令跟随提升。 - 安全套件:Llama Guard 2 → **Llama Guard 3**、Prompt Guard、Code Shield、CyberSec Eval 2。 **工具与智能体** - 3.1 起原生支持 **function calling / tool use / 结构化输出**,可接搜索、代码解释器、DB。 - Llama Stack 提供 Agent 编排参考实现,官方推合成数据生成与模型蒸馏工作流。 **多模态延伸** - 3.2 Vision 11B(~8GB VRAM 可跑)/ 90B 支持图像理解、图表读取、视觉问答。 * * * ## 性能定位(官方基准) - **Llama 3 8B**(初代):MMLU ~66.6,持平/超 Llama 2 70B,同尺寸优于 Gemma 7B、Mistral 7B。 - **Llama 3.1 405B**:MMLU 88.6、GPQA 61.6,发布时与 GPT-4o、Claude 3.5 Sonnet 同档。 - **Llama 3.3 70B**:MATH 较 3.1-70B +9.2,IFEval 92.1(超 405B),MGSM 多语 +4.2,文本任务逼近 3.1-405B 但成本低一个数量级。 * * * ## 如何使用 Llama 3 **开发者自托管 / 微调** - 权重下载:https://llama.meta.com/llama-downloads (需同意 Llama 3 Community License) - GitHub:https://github.com/meta-llama/llama3 - Hugging Face 集合:https://huggingface.co/collections/meta-llama/meta-llama-3-66214712577ca38149ebb2b6 - 本地运行:Ollama(`ollama pull llama3.3` / `llama3.1:8b`)、llama.cpp、vLLM、TGI - 微调:torchtune(Meta 官方)、PEFT/LoRA/QLoRA、Axolotl - 云推理:AWS Bedrock、Azure AI、GCP Vertex、Groq、Replicate(https://replicate.com/meta )、Fireworks、Together **普通用户免部署体验** - Meta AI(meta.ai / WhatsApp 内):**部分地区可用,不再严格锁区**,切到 Llama 3.1 405B 或 3.3 - HuggingChat:https://huggingface.co/chat (可切 Llama-3.3-70B-Instruct) - Replicate 在线 Demo:https://llama3.replicate.dev/ - 本地轻量:Ollama + 3.2-3B 在笔记本跑 * * * ## 关键信息与许可 - **许可**:Llama 3 Community License(研究+商用,月活 >7 亿产品需向 Meta 报备);3.1 起允许用模型输出蒸馏/改进其他模型。 - **权重性质**:open-weight(开放权重),非完全开源代码训练全流程;可离线、可私有化。 - **硬件参考**:8B Q4 ~5GB 内存可跑;70B BF16 需 ~140GB 显存(多卡),Q4 量化 ~40GB;405B 需多张 H100,FP8 量化可减半卡数。 - **上下文**:3.1+ 全系 128K;初代 8K 仅训练态,经 RoPE 扩展可推到 128K。 - **现状(2026-07)**:Llama 3.x 仍是 Meta 主推开放权重线;Llama 4(Scout/Maverick,MoE)已接棒旗舰,但 3.3 70B 因性价比仍是生产部署最常用选择之一。 * * * ## 核心优势 - **开放权重+可私有化**:数据不出域,金融/医疗/政企合规场景首选。 - **尺寸光谱完整**:1B 跑手机,405B 拼闭源旗舰,中间每档都有对应版本。 - **生态最成熟**:Ollama、vLLM、LangChain、LlamaIndex、torchtune、各云厂首日支持。 - **405B 开启开源旗舰时代**:首次让开源界拿到 GPT-4 级基座做蒸馏/合成数据。 - **3.3 70B 性价比王**:单卡 A100/H100 可服务,质量接近 405B,推理成本 1/5。 * * * ## 同类竞品对比 | 维度 | Llama 3.x(3.3/3.1) | Qwen3 / Qwen2.5 | Mistral / Mixtral | Claude / GPT(闭源) | | --- | --- | --- | --- | --- | | 权重开放 | ✅ open-weight | ✅ 部分开放 | ✅ 7B/8x7B 开放 | ❌ API only | | 最大尺度 | 405B(3.1) | 110B+ | 8x22B MoE | 未公开 | | 上下文 | 128K | 128K–1M | 32K–128K | 200K+ | | 多模态 | 3.2-Vision 11B/90B | VL 版本齐全 | 有限 | 原生多模 | | 端侧小模型 | 1B/3B | 0.5B–3B | — | — | | 中文能力 | 中上(需微调更优) | 强 | 一般 | 强 | | 商用门槛 | 月活>7亿报备 | 宽松 | 宽松 | 按 token 付费 | | 自托管成本 | 低(可量化) | 低 | 低 | 不适用 | * * * ## 应用场景 - **私有化知识库 / 企业助理**:3.3-70B 量化部署内网,接 RAG 不走公网。 - **端侧 App**:3.2-1B/3B 跑手机摘要、日程提取、本地翻译。 - **代码助手**:3.1-8B 本地补全,405B 做复杂重构评审。 - **多语客服**:3.1 八语对齐,做跨语言工单分类与回复草稿。 - **合成数据与蒸馏**:用 405B 产 SFT 数据,蒸馏到 8B 做线上轻量模型。 - **视觉文档抽取**:3.2-90B Vision 读扫描合同、报表、白板图。 - **科研复现**:开放权重可复现实验、做探针分析、改架构 ablation。 **Categories:** 资源下载 ---