Neutrino-1 8B模型:2026年7月27日可用,多平台支持且性能卓越!

【Fermion Research相关导航】

有模型、研究、新闻室、招聘信息等导航栏。还有X、Hugging Face、GitHub等社交链接,以及运行Neutrino - 1 8B的入口。Neutrino - 1 8B将于2026年7月27日可用。

【Neutrino-1 8B概述】

Neutrino系列的旗舰产品,采用编码三元系列容器,有36个解码器层,一个工件可支持数据中心GPU、MacBook和桌面CPU。可运行,有发布说明可阅读。其大小为2.56GB,下载无损;fp16的比特数为1/8;MMLU得分72.1;H100规格解码速度763 tok/s。它还有概述、架构、格式等多方面介绍。

【Neutrino-1 8B详细信息】

【概述详情】

Neutrino - 1 8B是仅含解码器的变压器模型,有81.9亿个参数,以3.88GB文件发布。252个变压器线性层用专有三元系列权重格式存储,比fp16小8倍;权重静止时位压缩,矩阵内核中解码,解码路径无fp16或fp32权重存储内容。小权重改变服务经济性,单流解码受令牌移动字节数限制,3.88GB工作集解码速度更快,整个模型可与KV缓存存于8GB GPU或16GB笔记本电脑,同一容器支持多平台。

【架构详情】

这是密集的仅含解码器的变压器模型。分组查询注意力使KV缓存为查询宽度四分之一,fp16下每个令牌144 KiB,4k令牌会话除3.88GB权重外需0.60GB缓存。基础模型是Apache - 2.0许可、阿里云的Qwen3 - 8B。参数包括6950万个编码投影权重、1.24亿个int8嵌入等,总计8190735360个。解码器层数36,隐藏宽度4096等。字节分布方面,变压器线性层采用编码格式,两个嵌入张量保持int8格式,文件三分之一是词汇表。编码通道内部,6950万个编码权重中62.63%为零,正负值比例分别为18.68%和18.69%,不同投影零值比例不同。

【格式详情】

一个容器有三种访问方式。下载的是编码传输文件,可精确扩展为运行文件,能在数据中心GPU和笔记本电脑运行。下载大小2.56GB,磁盘存储3.88GB。分发方式有pip引擎、GGUF包 + CUDA分支、MLX包,不同方式在不同设备上有不同速度。

【评估详情】

发布版本评估在禁用思考功能下对发布容器进行,评估协议涵盖多个方面。评估指标包括MMLU、MMLU - Redux等,各有对应得分。评估于2026年7月在标准公共测试平台进行,方法详见模型卡片。

【吞吐量详情】

单流解码速度决定提示和回复处理速度,不同平台和访问方式有不同速度,如H100 80GB在草稿模式下速度为763 tok/s等。这些是2026年7月的单流解码速度数据。

【推测解码详情】

Neutrino - 1 0.6B生成令牌草案,8B模型评分并保留一致前缀,输出流与普通贪心算法相同。加速效果取决于草案接受率,不同提示类别有不同速度和加速倍数。配对成本方面,草案模型可与验证模型在同一进程,有相应的驻留权重、草案额外成本等。在笔记本电脑上也可进行草案生成,有相关的速度、接受率等数据。

【运行方法与获取途径】

运行方法可通过两条命令开启流式聊天,还有本地OpenAI兼容服务器、选择模型等多种方式。获取模型可从Hugging Face、PyPI、GitHub等途径。

【可用性及相关情况】

Neutrino - 1 8B作为公共仓库发布,2026年7月27日可用,开放权重,采用Apache 2.0许可。还有许可说明和引用格式。此外还有相关研究介绍,可开始使用该模型体验前沿智能,可通过电子邮件订阅新闻通讯,有导航栏、公司信息、下载途径和联系方式等。