2.4万亿参数全开!阿里千问王炸开源,吊打一众顶尖模型
文章目录
- 1 今早AI圈直接炸锅了
- 1.1 阿里干了件没人想到的事
- 1.2 这可不是普通型号
- 2 这个模型到底有多能打
- 2.1 先看纸面参数
- 2.2 跑分有赢有输,但强项真的强
- 2.3 最狠的是能自己干长活
- 3 普通人能本地跑吗?有骚操作
- 3.1 原版大小一般人真扛不住
- 3.2 已经有人搞出压缩版了
- 4 最近大模型圈是真的卷疯了
- 4.1 短短几天三家轮番炸场
- 4.2 大家都在卷同一件事
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/HHX_01
1 今早AI圈直接炸锅了
1.1 阿里干了件没人想到的事
千问团队直接把Qwen3.8-2.4T-A95B的模型权重开放了。
说直白点,就是把自家旗舰级的大模型,原封不动放到了开源社区。
这感觉就像连锁火锅店,直接把锅底秘方打印出来贴大门口了。
1.2 这可不是普通型号
这个模型就是之前Qwen3.8-Max的基础版本,本月初刚发布的旗舰款。
带视觉输入、百万上下文、内置工具,该有的功能全都有。
以前这种级别的模型,你只能按token付费调用,连本地摸一下的机会都没有。
这次直接放开权重,属实是降维打击级别的操作。
2 这个模型到底有多能打
2.1 先看纸面参数
总参数2.4万亿,每个token激活950亿参数。
原生支持26万token上下文,拉满能到101万token。
101万token是什么概念?一整本长篇小说丢进去,它能从头记到尾。
换以前的模型,看个长合同都得分好几段喂,还经常看到后面忘前面。
2.2 跑分有赢有输,但强项真的强
论文复现测试PaperBench,拿了93分,比GPT-5.6 Sol、Fable 5都高。
电脑操作能力测试、参数化CAD测试,也都是第一名。
当然也不是全项第一,终端编程、软件工程基准、长视频理解这几项,还是略逊于头部对手。
相当于偏科学霸,数理化直接拉满,文科稍微弱一点,但整体还是第一梯队。
2.3 最狠的是能自己干长活
这次主打的就是长周期智能体能力,不用人盯着,它能自己把活干完。
官方测了连续自主编程16天,自己收集需求、写代码、修bug,全程不用人插手。
还能自己复现论文、打算法竞赛,甚至模拟开电商公司,跑了两千多轮交互。
以前的AI是你问一句它答一句,纯纯工具人。
现在这货,给个需求能自己干半个月,连摸鱼划水都不会。
3 普通人能本地跑吗?有骚操作
3.1 原版大小一般人真扛不住
原始模型体积4.9TB,先不说显存,很多人硬盘都装不下。
正常情况,这种万亿参数模型,只有数据中心能跑。
3.2 已经有人搞出压缩版了
有个团队搞了个量化技术,直接把模型压到了397GB,空间省了91%。
只要你设备内存加显存凑够410GB以上,就能本地跑起来。
虽然普通游戏本还是没戏,但至少工作站级别的设备能安排上了。
相当于以前只有航母能开的船,现在豪华游艇也能下水试试了。
4 最近大模型圈是真的卷疯了
4.1 短短几天三家轮番炸场
先是马斯克放出Grok 4.6,说性能跟顶级模型不相上下。
紧接着DeepSeek V4 Pro正式版上线,部分指标追平Fable 5。
转头阿里就直接把旗舰模型开源了,一波接一波根本停不下来。
4.2 大家都在卷同一件事
三家新模型,不约而同都在强化智能体能力。
比的不再是单道题答得对不对,而是能不能独立接一整个项目,自己闭环干完。
以前卷参数、卷跑分,现在卷“能不能自己上班”。
照这个节奏下去,再过两年说不定AI自己就能开公司,我们反倒成了给它打工的。
总得来说,这次阿里把万亿级旗舰模型开源,对国内开源圈绝对是个大节点。
后面肯定会冒出一堆基于它的新玩法,有的热闹看了。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01