一台置于办公桌上、体积略大于机顶盒的设备,内部搭载了数百GB的统一内存,即便断网也能运行千亿参数的大模型。它无需机房或机柜,通电即可使用,数据完全留在本地。这就是AI Box,一台被搬到办公桌上的数据中心。
在AI Box领域,苹果、英伟达、AMD、微软、英特尔等巨头均已入局。但这种产品形态并非新鲜事物,为何到了2026年,这个“接上显示器就是电脑”的小盒子成了各方争夺的焦点?
大模型有两种使用方式:调用云端服务,或在本地运行。
云端方案提供无上限的AI能力,模型无需自行维护,最强性能随时可用。但成本也很透明:订阅制下,ChatGPT Pro和Claude Max均为每月200美元封顶;超出部分按量计费,9月3日发布的GPT-6 Astra,输出价格为每百万token 50美元。对于重度使用智能体的用户,一次长任务可能输出数万token,每月花费数百到上千美元是常态。
业内人士指出,过去两年企业引入AI,大多卡在“从概念到落地”的摸索阶段:需要尝试场景、调整流程、优化提示词。这个过程中,每一分钟都在消耗token费用,而老板通常只给出方向,缺乏具体要求。“烧了很多钱,但能得出什么结果?没人知道。”
因此,本地部署的逻辑变得合理:主流模型大多开源免费(如DeepSeek、Qwen系列均采用宽松协议开源),硬件一次性购买后,不再有token账单,数据也不离开机房。预研、验证和反复试错的成本是固定的。
AI Box正是为此而生。
AI本地部署面临一个硬性门槛:模型必须能“装得下”,内存是AI Box的入场券。
运行大模型的前提是,其权重需全部加载到内存或显存中。以DeepSeek-R1满血版为例,它拥有6710亿参数,全精度(FP16)需要约1.3TB显存,FP8量化后约0.7至0.8TB,即使采用4-bit量化也需要400至480GB。作为对比,一张RTX 5090有32GB显存,一台高配笔记本有24至32GB统一内存——这些只能运行70亿参数级别的小模型。
这就是桌面AI设备面临的最大技术挑战:在一台能放在桌上的机器里,尽可能装入大容量统一内存,为模型提供高带宽,并将功耗控制在办公室插座能承受的范围内。
容量决定了能运行多大规模的模型,带宽决定了同时使用人数和输出速度,功耗则决定了它能否放在办公室而非机房。在这三个维度上,最有趣的现象是:准备最充分的那家公司,最初并非为AI设计。
2020年,苹果将Mac迁至自研M系列芯片,做出了一个当时看来相当大胆的决定:CPU、GPU和神经引擎共享同一块内存,内存即显存。这种统一内存(UMA)架构的初衷是减少数据在芯片间搬运的开销并降低功耗。
五年后,大模型时代到来,这套架构恰好满足了所有需求。
如今的Mac Studio,M3 Ultra版本最高可选512GB统一内存,内存带宽达819GB/s,整机最大持续功耗480W;9月22日发售的M5 Ultra款,带宽进一步提升至1.2TB/s,国行起售价46999元。苹果官方称,这台机器能运行超过6000亿参数的模型。据报道,过去几个月,OpenAI采购了数万台Mac mini和Mac Studio,用于强化学习和智能体开发,需求旺盛到多次催促苹果发货。库克在7月的财报电话会议上承认,“越来越多客户将Mac mini作为运行智能体的强大平台,部署Mac Studio集群在本地运行前沿模型”,并表示当季Mac一直面临供应限制。
如果说苹果是“无心插柳”,英伟达则是看到市场需求后的“降维打击”。
DGX Spark采用GB10 Grace Blackwell超级芯片,拥有128GB统一内存、273GB/s带宽,FP4精度下算力为1 PFLOPS,整机功耗240W,官方称单机可推理2000亿参数模型,两台互联可运行4050亿参数模型。美国官网售价4699美元,国行首发价约3万元,内存涨价后已接近4万。
单从纸面参数看,它对Mac Studio毫无优势。但DGX Spark运行的是DGX OS(Ubuntu),其软件栈与数据中心里的万卡集群同源,支持CUDA生态和企业级功能,开发者在桌上调试好的内容可无缝迁移到云端。
围绕英伟达DGX Spark,宏碁、华硕、戴尔、技嘉、惠普、联想、微星七家OEM同时推出了同芯片整机,微星版本低至2999美元,联想ThinkStation PGX去年7月已进入中国政企采购目录。相比苹果,英伟达为AI Box赋予了更清晰的市场定位和销售策略。
如果说Spark是给开发者的入门机型,DGX Station则是面向小团队的桌边工作站:配备GB300芯片、748GB一致性内存(252GB HBM3e加496GB LPDDR5X)、FP4精度下20 PFLOPS算力,整机功耗1600W,官方宣称能运行万亿参数模型。虽然功耗已触及普通办公室电路的上限,但仍比机房服务器低一个数量级。
今年6月Build大会上,微软发布了Surface RTX Spark Dev Box:与DGX Spark同款GB10芯片、128GB统一内存、1 PFLOPS算力,热设计功耗控制在100W,预装Windows 11 Pro开发者版,官方称本地可运行1200亿参数模型并支持百万token上下文,下半年在美国发售,媒体估价3000至3500美元。它的入场意义大于产品意义:Windows生态需要一个官方答案,告诉开发者本地AI不必非买Mac。
AMD的Ryzen AI Max+ 395(代号Strix Halo)将128GB统一内存和256GB/s带宽集成在55至120W的功耗范围内,NPU算力达50 TOPS,平台总算力约126 TOPS。今年三季度,换代的Ryzen AI Max 400(Gorgon Halo)会将统一内存上限提升至192GB,官方称可运行3000亿参数模型。
X86的底牌是兼容性:可直接安装Windows和Linux,企业现有运维体系全部复用。性能并非最强,但无需更换生态,这本身就是采购决策中的最大权重。
英特尔推出了Panther Lake(Core Ultra 300系),NPU算力50 TOPS,集成到每台笔记本和迷你主机中;最接近盒子形态的NUC 16 Pro,内存上限96GB,定位为Copilot+迷你PC。值得注意的是,英特尔的AI Box不仅限于桌面盒子,还将其应用于智能汽车,为过去算力不足的汽车提供性能加成。这表明英特尔将AI Box的目标锁定在更具体的B端场景中。
盒子卖出去后,实际产生了什么效果?
在高职教育场景中,学校将备课、批改、实训答疑、教案沉淀分别构建成教师、学生、管理三组智能体,装在盒子里本地运行。试点数据显示:教师周均备课时间从9.2小时降至5.1小时,每班批改时间从2小时压缩到0.4小时,实训错误率从22%降至14.3%,优秀教案复用率从不到10%提升至67%。
另一个是律所场景:卷宗不能离开律所,这正是盒子的用武之地:类案检索压缩到40秒以内,司法文书自动生成覆盖率达80%以上,利益冲突审查准确率超过95%。
这些场景的选择逻辑很清晰:重复性资料处理、数据安全敏感、结果可人工复核。而AI Box的优势也很明显:传统本地服务器方案需要机房改造,周期三到六个月;公有云API即时开通但数据存在出域风险;而盒子桌面即插即用、物理隔离,部署时间以小时计。
从卖算力到卖效率,这一转变本身说明:市场已过了“为参数买单”的阶段,开始为结果买单。
AI Box的潜力大小,取决于一笔经济账。
自建机房需要8张RTX 4090的整机,批发平台报价约35万元,整机峰值功耗超过4800W,需要机房、散热和工程师维护,必须配备独立机房。
云端AI能力无限,但token账单随使用量线性增长,摸索期花费无上限。
AI Box从千元到万元,功耗在100至480W之间,插电即用,模型免费,试错成本固定。与8卡服务器相比,功耗相差10到30倍。
摆在行业面前的问题是,ROI仍难以计算。真正掏钱的采购方,必须用自己的流程重新评估。客服这类能折算成“减少多少坐席”的场景容易量化,但流程优化和效率提升难以衡量。此外,如同自动驾驶推进中的权责问题,在实际工作中如果AI出错,谁来检查、谁来负责,仍没有答案。
现实情况是,当前成熟场景只有两个:写代码和办公,其余场景大多仍在摸索。而硬件只是门票:数据治理、微调、迭代以三到六个月为周期,模型一换,上层应用大概率需要返工。还有一个思考是,盒子通常无法升级,扩容只能再买一台机器。在DRAM成本高企的情况下,卖盒子似乎成了消化高价存储的一种方案。对市场而言,他们更需要看到AI Box到底能做什么。
AI Box并非要取代云。需要最强模型、弹性算力、零维护的任务,云端仍然是最优解。盒子承接的是另一类需求:反复试错的预研、不愿上云的数据、十来人小团队的固定算力、算得清电费和折旧的小本生意。
AI Box的出现,是将硬件做小,在支付固定成本后实现算力自由。归根结底,产品的未来在于算力如何落地,如何带来真正的价值。
本文来自微信公众号 “半导体产业纵横”(ID:ICViews),作者:六千,36氪经授权发布。