8月27日,苹果新款Mac Studio开卖的第二天,我下单了一台:M5 Ultra芯片,256GB统一内存,2TB硬盘,8万多元。
这不是冲动。去年M3 Ultra发布时我就动心过,512GB+16TB顶配国行10万出头,我被这个数字吓退了。
结果今年4月,苹果收缩M4产量、内存供给紧张,M3 Ultra一度一机难求,二手市场512GB内存版被标到约17万元——比原价高出近六成。我记住了一个教训:这类东西,犹豫的成本可能比买贵的成本更高。
所以这次我没再等。但比"买不买"更值得聊的,是背后那个判断:本地跑大模型,可能是AI接下来几年里一个被低估的方向。
这篇文章想把这个判断的证据和局限都摊开来说。
一、为什么是现在?
本地跑大模型过去卡在两头:硬件跑不动大模型,小模型又不够聪明。这一年,两头同时松动了。
硬件这头,苹果把算力堆上去了。
8月25日发布的M5 Ultra,统一内存最高512GB,带宽1.2TB/s(提升50%),每个GPU核心配了AI神经加速器。苹果的官方定位很直接:"在本地跑数千亿参数的大模型"。
引用「LM Studio」的测试,M5 Ultra处理提示词速度是上一代的4倍。MacStories创始人Federico Viticci估算,M5 Ultra理论上能到120+词元/秒,"比大多数AI聊天网站还快",虽是推算,但他有一个已经发生的事实:他管理的iOS 27评测项目工作流,现在完全由本地跑在Mac Studio上的DeepSeek-V4-Flash代理接管,不是演示,是日常。
模型这头,开源模型在"变小变聪明"。
Qwen官方说"Qwen3-4B可媲美Qwen2.5-72B-Instruct"——4B参数媲美18倍参数量的上一代。今年一篇arXiv论文也发现,边界清晰的具体任务上,0.5B到3B小模型效率比70B以上大模型高40到90倍,精度损失10%到35%。
再加上"harness"(模型外负责调用工具、拆解任务的执行框架),同一个模型配不同harness表现天差地别,这是行业实践共识,还没有严谨学术验证。
这也是我选256GB而不是512GB的原因之一(另一个原因是512GB要到10月才上市):调优的中小模型加合适工具链,已经能顶替过去需要巨兽模型才能干的活。
硬件带宽、模型效率、工具链,三条线同时在推,比单靠硬件堆料更能走远。
二、还有谁这么想?
下单三天后,一条新闻佐证了我的方向。
8月30日,The Information记者Aaron Tilley报道:OpenAI近几个月购买了数万台苹果Mac mini和Mac Studio,用于训练能操作电脑的AI智能体。需要澄清:这些Mac不是给基础模型做预训练用的算力,而是提供真实的计算机操作环境——智能体在里面反复练习、被评估,产出的数据喂给强化学习。
Anthropic也一直通过AWS租用Mac mini做类似的事。
"数万台"是媒体转述数字,我没找到第二个独立信源核实,算待核。但库克在7月财报电话会议上的原话公开可查:"我们看到越来越多客户……从将Mac mini用作运行智能体AI的平台,到部署Mac Studio集群在本地运行前沿级模型。"
苹果整体Mac业务当季营收创纪录达94亿美元,同比增长约29%。
这条新闻的意义不在"数万台"准不准——不只是个人用户,OpenAI和Anthropic这两家最有能力自建云端算力的公司,要的也是苹果统一内存架构:CPU和GPU共享大内存池,让模型和真实操作环境在同一台设备上跑起来。
更贴近我场景的是另外两个案例。6月4日,「LM Studio」发布「Locally」+「LM Link」:iPhone/iPad原生App通过端到端加密连到你的Mac,Mac跑模型,手机只是终端。
9月1日,Perplexity上线「Hybrid Compute」:规划和搜索留在云端,涉及本地文件就切到用户自己的Mac上跑本地模型。两个案例相隔不到三个月,都是主流消费级产品的正式功能。
国内也有类似产品「Infortress」,只是它是小工作室的产品,规模不在一个量级。
跟这几个案例比,我的场景是:开发一款嵌入本地大模型的AI助手APP,这台Mac Studio给它当本地推理服务器——跟「LM Studio」「Perplexity」的产品形态最接近,跟OpenAI/Anthropic训练智能体的规模和用途差得远。
底层判断是一样的:某些AI负载,本地统一内存比纯云端更划算,甚至更必要。这不再只是我一个人的赌注。
三、性价比怎么算?
M5 Ultra版Mac Studio国行起售价46999元(96GB/1TB基础款);我的256GB+2TB配置花了8万多,几乎翻倍。
组集群更贵——Viticci估算一套能媲美云端的本地集群要2万美元以上(约合13万元)。量化压缩会让输出质量打折,具体打几折因模型而异,没找到统一数据,这里不编。
在中国大陆,这笔账还有一层参照:官方渠道能拿到同等大内存方案的选择不多。受出口管制影响,数据中心级H100、A800长期涨价;
国行RTX 4090也被换成阉割版4090D,显存锁死在24GB。想在官方渠道凑够256GB级别显存基本无解,因此出现了"魔改48GB显卡"——市场价2.5万至3.5万元,只有48GB,不到我这台机器的五分之一,没有官方质保。
Mac Studio有官方质保、以旧换新、分期付款,开箱即用,持续跑70B模型机身温度40-45°C,比多数PC工作站安静,这也是不少测评者提到的"省心"。隐私上,本地部署的优势自己攒PC同样具备;
但macOS的遥测比不少国内定制系统更克制,这是我个人判断,没有统一数据支撑。综合看,在中国大陆,Mac Studio目前是本地大模型算力里性价比最突出的官方选项。
这些是现阶段的门槛,不是方向错了的证据。
门槛不等于人人都该买。偶尔调用API,云端几乎总是更省钱;
真正算得过来这笔账的,是需要高频、长期、且必须离线运行的两类人。
对数据保密有要求的私营企业。
客户名单、财务数据、诉讼材料——这类企业最不能外泄的东西,云端即便承诺"不训练",信任本身仍有成本。这条对我自己也成立——我在开发的AI助手APP,产品逻辑和用户数据是这家"一人公司"不想被第三方API看到的东西,道理和一家律所一样,只是规模缩到了我一个人。
海外已有专门给律所、医疗机构做的本地部署指南,把Mac Studio列为可选硬件:律所要保住保密特权,医疗机构要满足HIPAA合规(美国的患者医疗信息隐私法规,违规有实质处罚,逻辑类似国内的个人信息保护法)。如实说,这是行业推荐做法,不是已验证案例,没找到点名某家企业已经这么部署的公开报道。
涉密的政府部门我没有把握放进这份名单——国内政务系统更常见服务器级国产算力。
科研人员。
痛点不是隐私,是可复现性。今年一篇arXiv论文试图重现85篇用商业大模型API做实验的论文:只有5篇能完全复现。
云端模型不停更新弃用旧版本,同样输入半年后结果不同;本地部署固定版本的开源模型,能把这个变量锁死。
两类用户的共同点:要的不是更强的AI,是AI能力和数据主权同时拥有。
四、回到"主导权"
在前面的文章里我引过李飞飞的话——"主导权应该在人类手中";做「Moment·此刻」时,我把"数据本地优先、随时可导出"当成不能让步的原则。
本地跑大模型是同一个理念在硬件层面的延伸:你的问题不经过任何公司的服务器,决定权在自己手里。
云端AI不该被抛弃,大多数轻量任务它依然更划算。但本地化正在从"理论可行"变成"现在能落地"——OpenAI和Anthropic在投入真金白银,「LM Studio」和Perplexity已经做成了普通用户能直接用的产品功能。
我抢下这台机器,赌的是一个可以被日后核对的判断:三到五年内,"云端做规划、本地Mac跑隐私推理"这类架构,会从少数产品的亮点功能,变成AI助手类应用里一个常见的、不用特别解释的选项——就像今天问一款SaaS产品"支不支持SSO"一样自然(SaaS是订阅制的云端软件服务,SSO是单点登录、一套账号登录多个系统;现在问一款SaaS产品支不支持SSO,是采购时的常规检查项,不是什么稀奇的技术要求)。
不是每个人都需要现在跟我一样下单——需要当下最强能力的任务,云端前沿模型依然更稳;只是想体验一下,也不必急于这一时。
但如果有一个具体的、需要长期离线运行的场景,256GB这类中间档位通常比顶配更划算,真实的模型体量需求,比预算数字更值得先想清楚。
本地化这条路还在爬坡。但爬坡本身,往往就是方向值得投入的信号——如果已经是坦途,就轮不到普通人来"抢"了。
参考来源:
- IT之家:512G+16T版也支持国补,M3 Ultra Mac Studio 106749元补货
- 新浪财经:苹果Mac价格被炒上天!二手M3 Ultra版Mac Studio直接涨到170000元(2026年4月24日)
- 苹果新闻室:M6与M5 Ultra官方发布
- 苹果新闻室:新款Mac Studio(M5 Max/M5 Ultra)官方发布
- 9to5Mac:新一代Mac Studio发布报道(含LM Studio基准数据)
- MacStories:M6与M5 Ultra对本地AI的潜力分析
- Qwen官方博客:Qwen3:思深,行速
- arXiv:《Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models》
- IT之家:消息称OpenAI购入数万台苹果Mac mini/Studio,用于训练AI智能体操作计算机(转引The Information记者Aaron Tilley 8月30日报道,含库克7月财报电话会原话)
- Digital Applied:LM Studio发布Locally iPhone应用与LM Link(2026年6月4日发布,端到端加密连接手机与Mac本地模型)
- Digital Applied:Perplexity在Mac客户端上线Hybrid Compute(2026年9月1日发布,云端规划+本地Mac跑隐私推理)
- Infortress官网:内网穿透远程访问本地大模型(电脑服务端+手机客户端,开发者为北京磐石纳斯科技工作室,腾讯应用宝官方上架)
- IT之家:新款Mac Studio国行价格报道
- 英为财情(Investing.com):美元兑人民币实时汇率
- 新浪财经/观察者网:英伟达发布中国特供版RTX 4090D,CUDA核心削减约11%(出口管制背景)
- 知乎:魔改的RTX 4090 48G卡值得选吗?(含魔改工艺、2.5万-3.5万元售价区间、Ada 6000专业卡48GB约5万元报价)
- 什么值得买:二手市场惊现魔改RTX 4090D 48GB显卡,6000美元高价暗藏风险(含"拆芯片卖空壳"骗局案例、噪音实测)
- 晨涧云AI算力平台:RTX 4090 48GB魔改版评测(含出口管制下A800、H100涨价背景)
- 53AI:同等价位Windows主机 VS Mac Studio,AI推理谁更强(RTX 4090D峰值功耗≥450W、需水冷维持稳定)
- 知乎:Mac Studio跑本地大模型完全指南(M3 Ultra持续跑70B模型机身温度40-45°C、风扇噪音明显但比多数PC工作站安静)
- 腾讯新闻:Mac Studio跑满血DeepSeek R1对比测试(引用Max Weinbach关于Apple Silicon"省心"、MLX优化的评价)
- iFeeltech:Private AI Server Guide: Mac Studio vs Custom PC for Business(含律所/医疗机构HIPAA合规场景与20人律所企业级AI订阅年成本7200-12000美元的估算)
- PromptQuorum:Best Local LLM Setup for Legal and Medical Document Privacy?(列出Mac Studio 32GB+统一内存作为律所/医疗文档本地部署的可选硬件)
- arXiv:《Reflections on the Reproducibility of Commercial LLM APIs》