人工智能行业专题(19):从Nebius看新兴云与开源模型Token优化
核心结论
Nebius是全栈自研AI原生云代表厂商,工程基因是核心壁垒。公司脱胎于Yandex,继承20年分布式基础设施能力,形成“裸金属算力→多租户云→Token Factory托管推理(25年底落地)→智能代理层(规划)”的四层产品架构。Nebius代表的不仅GPU租赁商,而是一种"全栈垂直整合"的新兴AI云范式——通过硬件自研、编排自控、模型自优化的三层能力叠加,将开源模型的推理成本最高砍掉70%,从而推动AI推理从"闭源模型依赖"向"开源模型替代"的结构性迁移。
底层:自研高密度ODM机架与工程基因构建成本护城河。比较AWS,AWS微调的TCO(总拥有成本)比Nebius贵43%,推理TCO(总拥有成本)贵112%。新兴云具备裸金属去虚拟化、InfiniBand直连、无通用云搭售等成本优势。特殊的是,根据SemiAnalysis和官网,Nebius是唯一一家使用定制ODM机箱的新兴云厂商,预计节省10-15%OEM溢价。根据官方白皮书,自研液冷方案将服务器功耗降低约20%。除此以外,Nebius拥有GPU弹性打包+双栈调度回收侧优化,相比较其他新兴云能够回收约5-15%闲置算力。
中层:Token Factory通过收购Eigen AI实现模型层全栈优化,帮助提升单GPU收入,客户部署成本下降。Eigen推理优化让单卡Token吞吐提升2-3倍,从而把单卡Token产出提升至2-3倍,与此同时,Token价格基本和原模型一致。所以,同样的硬件成本Nebius能卖出更多收入。除此以外,对于客户来说,Nebius Token Factory的Token优化能力可有效降低客户AI推理部署的全链路成本。传统部署路径下,客户若选择裸金属自部署,需要用更多的卡完成同等每日Token量需求。
Token Factory案例一定程度证实了"开源替代闭源模型"的经济性。Revolut因成本失控从顶尖闭源模型全面迁移至Token Factory上的Kimi2.5;Cosine因银行/国防客户的数据不出墙要求,通过Papyrax后训练框架将Llama3.370B调教至OpenAI O3水平。非Nebius案例同样印证趋势:Shopify将Qwen3-32B微调后推理速度2.2倍、成本下降68%;Coinbase形成"开源模型GLM-5.2、Kimi2.7承接常规调用、闭源模型处理复杂任务"的分层架构,AI支出接近减半。