用户提问:
Nemotron-3-Nano-30B-A3B-GGUF
---

用户输入是:"Nemotron-3-Nano-30B-A3B-GGUF",这看起来像是一个具体的模型名称,可能是某种AI模型或机器学习模型的标识。

让我分析这个名称:

  • Nemotron:可能是模型系列名称
  • 3-Nano-30B:表示版本和参数规模(Nano版本,30B参数)
  • A3B:可能是某种变体或特定的配置
  • GGUF:这是一个关键标识,GGUF是llama.cpp项目使用的模型文件格式

这个查询看起来是想了解关于这个特定模型的信息。用户没有提供具体的问题类型(比如是什么、在哪里下载、如何使用等),所以我应该先进行广泛的搜索来了解这个模型的基本信息。

根据指导原则,我需要:

  1. 先进行需求解读和初步搜索规划
  2. 编制3-6个不同角度的搜索关键词
  3. 并行调用搜索
  4. 避免过早限制信息范围

搜索规划:

  1. 基础信息搜索:完整模型名称 - 了解这是什么模型
  2. GGUF格式角度:Nemotron-3 GGUF - 了解GGUF格式相关信息
  3. 参数规模角度:Nemotron-3 30B - 了解模型参数和性能
  4. 下载使用角度:Nemotron-3-GGUF download 或 usage
  5. A3B变体角度:可能涉及A3B特定信息

我将立即启动多个搜索通道,获取模型的关键信息。

我来帮你了解"Nemotron-3-Nano-30B-A3B-GGUF"这个模型🔍

需求解读与搜索规划

从模型名称来看,这很可能是一个:

  • Nemotron-3 系列的模型
  • Nano 版本(轻量化变体)
  • 30B 参数规模
  • A3B 特定变体配置
  • GGUF 格式(llama.cpp生态的模型文件格式)

我将从多个角度进行并行搜索,以全面了解这个模型的信息:

  1. 基础信息与介绍
  2. GGUF格式与部署使用
  3. 性能规格与参数
  4. 下载来源与获取方式
  5. A3B变体特性

现在开始搜索🚀

Nemotron-3-Nano-30B-A3B-GGUF
Nemotron-3 GGUF model
Nemotron-3 30B Nano
Nemotron-3 A3B GGUF download
Nemotron-3 30B performance
NVIDIA Nemotron-3 GGUF

搜索结果非常丰富,我发现了大量关于Nemotron-3-Nano-30B-A3B-GGUF的信息。让我分析一下:

主要发现:

  1. 这是NVIDIA开发的30B参数的混合推理MoE模型
  2. 使用混合Mamba-Transformer架构
  3. GGUF格式是由Unsloth等团队转换的
  4. 有多个GGUF量化版本可用
  5. 支持1M token上下文窗口
  6. 性能方面优于Qwen3和GPT-OSS
  7. 运行效率很高

现在我需要深入阅读一些关键页面来获取更详细、准确的信息。我应该选择以下关键来源:

  1. NVIDIA官方模型卡(build.nvidia.com)- 了解官方介绍和规格
  2. HuggingFace上的Unsloth GGUF版本 - 了解GGUF版本详情
  3. NVIDIA官方技术报告/文档 - 了解技术细节
  4. 性能评测页面 - 了解性能数据
  5. 使用指南 - 了解如何使用

让我并行读取这些页面。

非常好!搜索结果很丰富🎉 我找到了关于Nemotron-3-Nano-30B-A3B-GGUF的大量信息源。现在让我深入阅读几个关键页面来获取完整信息:

关键发现预览:
  • NVIDIA最新发布的30B参数混合推理MoE模型
  • 采用混合Mamba-Transformer架构
  • 支持高达100万token上下文
  • GGUF格式由Unsloth等团队优化转换
  • 性能超越Qwen3和GPT-OSS

现在开始深度阅读关键页面📖

我已经收集了大量关于Nemotron-3-Nano-30B-A3B-GGUF的信息。让我总结一下已经获得的关键信息:

  1. 模型基本信息
    • NVIDIA开发的30B参数MoE模型
    • 采用混合Mamba-Transformer架构
    • 总参数31.6B,每前向激活3.2B参数(含嵌入层3.6B)
    • 支持最大1M tokens上下文
  2. 性能数据
    • 推理速度:比Qwen3-30B-A3B-Thinking-2507快3.3倍,比GPT-OSS-20B快2.2倍
    • MATH任务:82.88%准确率
    • GSM8K:92.34%
    • HumanEval@0-shot:78.05%
    • RULER@1M:98.7%(或87.50%,这里有两个来源数据不一致)
  3. GGUF版本信息
    • 由Unsloth等团队转换
    • 提供多种量化级别
    • 支持本地部署
  4. 运行要求
    • 需24GB RAM/VRAM
    • 推荐使用4-bit量化版本

但我注意到一些信息还需要补充:

  1. 具体的GGUF量化选项和文件大小(Unsloth页面提到了但未详细列出)

  2. 详细的下载和使用指南

  3. 与其他模型的具体对比数据

  4. 许可证和开源协议的具体内容

  5. 性能数据中的差异点需要进一步验证

我将深入研究许可证条款,特别是NVIDIA开源协议的具体使用限制和范围。同时,我会重点关注性能数据的不一致之处,寻找更多可靠来源进行交叉验证。

继续深入了解更多细节信息,特别是量化选项、下载指南和具体性能数据

用户的问题是"Nemotron-3-Nano-30B-A3B-GGUF",这是一个模型名称。我需要为用户提供关于这个模型的全面信息。

让我总结已经收集到的信息:

  1. 模型基本信息
    • NVIDIA开发的30B参数MoE模型
    • 采用混合Mamba-Transformer架构
    • 总参数31.6B,每前向激活3.2B参数(含嵌入层3.6B)
    • 支持最大1M tokens上下文
  2. 性能数据
    • 推理速度:比Qwen3-30B-A3B-Thinking-2507快3.3倍,比GPT-OSS-20B快2.2倍
    • MATH任务:82.88%准确率
    • GSM8K:92.34%
    • HumanEval@0-shot:78.05%
    • RULER@1M:98.7%(或87.50%,这里有两个来源数据不一致)
  3. GGUF版本信息
    • 由Unsloth等团队转换
    • 提供多种量化级别
    • 支持本地部署
  4. 运行要求
    • 需24GB RAM/VRAM
    • 推荐使用4-bit量化版本
  5. 量化选项和文件大小 (从bartowski的页面获得了详细信息)
    • BF16(63.18GB)
    • Q8_0(33.51GB)
    • Q6_K_L(33.43GB)
    • Q5_K_L(26.26GB)
    • Q4_K_L(24.79GB)
    • Q4_K_M(24.66GB)
    • Q4_K_S(22.39GB)
    • Q4_1(20.06GB)
    • Q3_K_XL(19.59GB)
    • Q3_K_L(19.41GB)
    • 等等多种量化选项
  6. 部署方式
    • 支持Ollama、LM Studio等本地部署工具
    • 兼容多种推理引擎

我注意到模型的性能和部署选项非常丰富,特别是在量化和本地部署方面提供了灵活的选择。这些量化级别允许用户根据硬件条件选择最合适的模型版本。

多个数据源存在显著差异,需要仔细验证和比对。

RULER@1M的准确率在98.7%和87.50%之间存在不一致,这种差异可能源于不同测试环境或版本。我需要查找更多可靠的数据源来确认准确的具体数值。

"Nemotron-3-Nano-30B-A3B" "RULER" 1M 87.50
"Nemotron 3 Nano" RULER 1M 98.7

用户想要了解"Nemotron-3-Nano-30B-A3B-GGUF"这个模型。从已经收集的信息来看,我已经获得了大量有价值的信息,包括:

  1. 模型基本信息
  2. 架构特点
  3. 性能数据
  4. GGUF版本详情
  5. 量化选项和文件大小
  6. 使用指南

让我整理一下已收集的信息:

模型基本信息
  • NVIDIA开发的30B参数混合推理MoE模型
  • 采用混合Mamba-Transformer架构
  • 总参数31.6B,每前向激活3.2B参数(含嵌入层3.6B)
  • 支持最大1M tokens上下文
  • 支持语言:英语、德语、西班牙语、法语、意大利语、日语
  • 发布时间:2025年12月15日
性能数据
  • 推理速度:比Qwen3-30B-A3B-Thinking-2507快3.3倍,比GPT-OSS-20B快2.2倍
  • MATH任务:82.88%准确率
  • GSM8K:92.34%
  • HumanEval@0-shot:78.05%
  • RULER@1M:存在不一致数据(87.50%或86.34%,需要确认)
GGUF版本信息
  • Hugging Face上的GGUF版本
  • 从bartowski的页面获得了详细的量化规格和文件大小
硬件要求

该模型对硬件性能要求较高,推荐24GB显存支持本地部署。用户可选择4-bit量化版本,并在多种软件环境中运行,如vLLM、Ollama等推理引擎。这种灵活性使得模型能适应不同的使用场景和计算资源。

用户询问"Nemotron-3-Nano-30B-A3B-GGUF",这是一个非常具体的模型名称。从搜索结果来看,我已经收集了相当丰富的信息。现在让我整理和分析这些信息:

已收集的关键信息:
  1. 模型基本信息
    • 开发者:NVIDIA Corporation
    • 模型架构:混合Mamba-Transformer + MoE(混合专家)架构
    • 总参数:31.6B(约30B)
    • 每前向激活参数:3.2B(含嵌入层共3.6B)
    • MoE配置:128个专家,激活6个专家+1个共享专家
    • 层结构:23个Mamba-2和MoE层,6个注意力层
  2. 上下文窗口
    • 默认256K tokens
    • 最大支持1M tokens
  3. 语言支持
    • 英语、德语、西班牙语、法语、意大利语、日语
  4. GGUF版本信息
    • 多个量化级别可供选择
    • 文件大小从18GB(IQ2_XXS)到63.18GB(BF16)不等
    • 推荐:Q4系列、IQ4_XS等
  5. 性能数据
    • 推理速度:比Qwen3-30B-A3B-Thinking-2507快3.3倍,比GPT-OSS-20B快2.2倍
    • MATH任务:82.88%准确率
    • GSM8K:92.34%
    • RULER@1M:存在多个数据点,需统一

我注意到不同来源的数据存在显著差异,特别是在RULER长文本任务上。这种不一致性可能源于测试方法、参数配置或评估标准的细微差异。需要进一步交叉验证和标准化这些性能指标。 我注意到RULER@1M指标在不同文档中存在显著差异,从87.50%到91.7%不等。这种数据不一致性需要谨慎处理,明确标注来源和可能的解释原因。

许可证页面访问遇到了技术障碍,导致无法获取具体的许可信息。同时,训练数据量也存在矛盾,不同来源报告从10.6万亿到25万亿token不等。这些差异反映了模型技术信息的复杂性,需要更深入的交叉验证和澄清。

我已经收集了关于Nemotron-3-Nano-30B-A3B-GGUF的大量信息。让我为你整理一个全面的介绍📋

🤖 Nemotron-3-Nano-30B-A3B-GGUF 完整指南

一、模型基本信息 📊

Nemotron-3-Nano-30B-A3B-GGUF 是NVIDIA于2025年12月15日发布的开源大语言模型,采用创新混合架构697073

核心规格

  • 开发者 :NVIDIA Corporation
  • 模型架构 :混合Mamba-Transformer + Mixture-of-Experts (MoE) 架构
  • 总参数量 :31.6B(约30B)
  • 活跃参数 :每前向传播激活3.2B参数(含嵌入层共3.6B)6970
  • MoE配置 :128个专家,每次激活6个专家 + 1个共享专家7076
  • 层结构 :23个Mamba-2和MoE层 + 6个注意力层7376

上下文与语言支持

  • 上下文窗口 :默认256K tokens,最高支持1M tokens(约1500页A4文本)737690
  • 支持语言 :英语、德语、西班牙语、法语、意大利语、日语7376

二、技术架构创新 🏗️

混合MoE架构

  1. Mamba-2层 :处理长序列和高效推理
  2. MoE层 :稀疏专家网络,仅激活部分专家,大幅提升效率
  3. 注意力层 :关键位置的精细处理
  4. InfiniByte技术 :跨领域代码生成方法,融合数学、物理等多学科问题69

推理功能

  • 推理轨迹生成 :默认启用enable_thinking=True,生成推理轨迹提升复杂任务准确性7390
  • 推理预算控制 :支持推理时的推理预算控制,允许用户在精度和效率之间进行权衡89

三、GGUF版本详情 💾

GG量化选项与文件大小(来自bartowski版本)77

量化级别文件大小说明
BF1663.18GB完整BF16权重,无损质量
Q8_033.51GB极高量化质量
Q6_K_L33.43GB高质量量化,嵌入和输出权重使用Q8_0
Q5_K_L26.26GB高质量量化,使用Q8_0嵌入和输出权重
Q5_K_M26.15GB高质量量化,推荐使用
Q4_K_L24.79GB良好质量量化,使用Q8_0嵌入和输出权重
Q4_K_M24.66GB良好质量,默认大小,推荐使用 ✨
Q4_K_S22.39GB略低质量但节省空间,推荐使用
Q4_120.06GB传统格式,在Apple硅上性能改进
IQ4_XS18.13GB良好质量,小于Q4_K_S且性能相似,推荐使用 ✨
Q3_K_XL19.59GB较低质量但可用,适合低内存
Q3_K_L19.41GB较低质量但可用,适合低内存
Q3_K_M18.99GB低质量
IQ3_XXS18.10GB较低质量,新方法

推荐量化选择

  • 24GB显存 :Q4_K_M(24.66GB)- 最佳平衡点75
  • 更高精度 :Q5_K_M(26.15GB)或Q6_K系列
  • 极致压缩 :IQ4_XS(18.13GB)- 性价比高

四、性能表现 🚀

推理速度优势

在8K输入/16K输出配置下:

  • 比Qwen3-30B-A3B-Thinking-2507快3.3倍
  • 比GPT-OSS-20B快2.2倍 6970
  • 输出速度达263.0 tokens/秒(Artificial Analysis排名第一)72

基准测试表现

任务类型指标Nemotron 3 Nano对比模型
数学推理MATH82.88%Qwen3: 61.14%69
数学推理GSM8K92.34%-70
数学推理AIME2589.1%-89
代码生成HumanEval@0-shot78.05%-70
代码生成MBPP-Sanitized@3-shot75.49%-70
代码生成SWE-Bench38.8% 76 / 49.0% 89不同数据集
长上下文RULER@1M87.50% 69 / 91.7% 89存在不同数据源
长上下文LiveCodeBench v668.3%Qwen3: 66.0%, GPT-OSS: 61.0%42
推理能力GPQA75.7%-53

成本分析(API服务)72

  • 输入价格 :$0.06/1M tokens
  • 输出价格 :$0.24/1M tokens
  • 智能评测总成本 :$7.68

五、部署与使用 🛠️

硬件要求

配置要求说明
推荐显存24GB RAM/VRAM(RTX 3090/4090级别)75
最低配置18GB可用内存(使用IQ2/IQ3量化)
存储空间需预留模型文件大小 + 缓存空间

使用方法

1. 使用Ollama90

1# 本地运行 2ollama run nemotron-3-nano:30b 3 4# 云端运行 5ollama run nemotron-3-nano:30b-cloud

2. 使用LM Studio75

  • 下载GGUF文件
  • 启用"将尽可能多的层卸载到GPU"选项
  • 根据显存调整卸载策略

3. Python API示例73

1from transformers import AutoTokenizer, AutoModelForCausalLM 2import torch 3 4tokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16") 5model = AutoModelForCausalLM.from_pretrained( 6 "nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16", 7 torch_dtype=torch.bfloat16 8)

推荐参数配置7376

  • 通用聊天/推理任务
    • temperature=1.0
    • top_p=1.0
  • 工具调用场景
    • temperature=0.6
    • top_p=0.95
  • 本地使用
    • max_new_tokens: 32,768至262,144(标准提示)
    • 1M上下文需根据硬件调整

六、获取方式 📥

主要下载源

  1. Hugging Face
    • Unsloth版本:unsloth/Nemotron-3-Nano-30B-A3B-GGUF73
    • Bartowski版本:bartowski/nvidia_Nemotron-3-Nano-30B-A3B-GGUF77
    • 官方原始模型:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF1667
  2. Ollama库
    • 模型名称:nemotron-3-nano90
  3. ModelScope
    • moxin-org/Nemotron-3-Nano-30B-A3B-GGUF11

七、数据与训练信息 📚

训练数据697076

  • 预训练数据 :存在不同数据源报告
    • 一份技术报告:25万亿token,涵盖15类数据
    • 官方模型卡:10.6万亿token,涵盖代码、数学、科学、多语言等
    • 包含3.5万亿合成数据(InfiniByte、RQA数据集)
  • 后训练数据 :18M样本(SFT),涵盖多轮对话、工具调用、形式化证明

时间窗口7690

  • 预训练数据截止 :2025年6月25日
  • 后训练数据截止 :2025年11月28日

八、许可证与使用限制 ⚖️

  • 许可证 :NVIDIA Nemotron Open Model License Agreement76
  • 可用性 :可用于商业用途76
  • 开放性
    • ✅ 开放模型权重
    • ✅ 开放训练配方
    • ✅ 开放部分数据集(Nemotron-CC-Code-v1、Nemotron-Pretraining-Specialized-v1等)69

九、适用场景与优势 ✨

最佳适用场景

  1. AI智能体应用 :专为agentic AI应用优化3176
  2. 代码生成与调试 :SWE-Bench表现优异
  3. 数学推理 :MATH和GSM8K分数领先
  4. 长文档处理 :1M上下文窗口支持长文本
  5. 本地部署 :24GB显存即可运行高质量版本
  6. 工具调用 :支持多步推理和工具使用69

核心优势

  • 极致推理速度 :同类模型最快72
  • 💰 高性价比 :开源免费,本地运行成本低
  • 🧠 强大推理能力 :数学、代码、长上下文全方位优秀
  • 📏 超长上下文 :1M tokens支持长文档和复杂任务
  • 🌐 多语言支持 :6种语言覆盖主要市场
  • 🔧 灵活部署 :支持多种量化级别和部署方式

十、注意事项 ⚠️

  1. 数据时间差异 :训练数据存在不同数据源报告的差异(10.6万亿vs25万亿token)6976
  2. 性能数据来源 :RULER@1M长上下文任务存在不同数据点(87.50%69 vs 91.7%89
  3. 量化建议 :对于代码和数学任务,建议使用Q4或更高精度量化,避免过度量化导致精度下降75
  4. 推理轨迹 :启用推理轨迹(enable_thinking=True)会提升复杂任务准确性,但可能降低简单任务的速度73
  5. 许可证限制 :虽然模型开源,但使用仍需遵守NVIDIA Nemotron Open Model License Agreement76

总结 🎯

Nemotron-3-Nano-30B-A3B-GGUF 是一款性能强劲的开源大语言模型,特别适合:

  • 需要本地部署的AI智能体应用
  • 对推理速度有严格要求的场景
  • 需要长上下文处理的任务
  • 代码生成、数学推理等专业领域
对于拥有24GB显存的用户, Q4_K_M量化版本(24.66GB)是最佳选择 ,在质量和性能间达到了完美平衡75
💡 小贴士 :如果你使用LM Studio,记得启用"offload all layers"选项以获得最佳性能75
5