一张3090就能跑!全栈国产模型,把AI办公搬到企业本地

  henry 发自 凹非寺

  量子位 | 公众号 QbitAI

  AI办公这块蛋糕,中国电信可能要先切走一块了。

  这个夏天,大厂们集体加注AI办公。卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。

  但就在大伙忙着抢入口的时候,还有一批企业,连门都没进去。

  原因现实得很扎心。他们数据不能出域,模型最好就地部署,手头算力又不算富裕。可偏偏,长文档要读,复杂业务要办,该干的活一样不少。

  中国电信AI这次最新开源的Xing4.0-29B-A4B,瞄准的就是这批需求。

500

  而且,这次带来的还是一款全栈国产化的轻量级代码智能体大模型。从国产芯片、国产训练框架,到模型训练和推理部署,整条技术链路都做了系统适配。

  为了尽可能实现本地部署,Xing4.0-29B-A4B采用MoE架构,290亿的总参数,每次推理只激活约40亿参数,经过4-bit量化后,一张RTX 3090就能运行。

  当然,跑起来只是第一步。

  企业真正关心的,还是这张显卡上的模型,到底能干多少活。

  比如,处理重要文档时,模型可以直接在本地完成内容理解、指标提取和信息整理,数据全程不用离开企业环境。

  

  再比如,一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。

  

  更进一步,它对本地部署的考虑,也不只停留在消费级显卡上。

  Xing4.0-29B-A4B完全基于华为昇腾910C算力训练,并采用国产的MindSpore/MindFormers训练框架与开发套件,真正实现了国芯训国模。

  在推理部署端,它还完成了昇腾的适配验证。可以说,从训练到落地,国产算力这条路也已经走通。

  目前,模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。

  值得一提的是,截止发稿,Xing4.0-29B-A4B现在已经冲进HuggingFace模型趋势榜单,位居第四。

500

  感兴趣的朋友,可以直接用起来了。

  (相关链接在文末)

  既要跑得动,也要真的能干活

  老实说,把模型装进一张显卡,和让它稳稳接住企业的日常工作,中间还隔着不少事。

  毕竟,企业交过来的任务,很少只有一句问答那么简单。

  一份文档读完了,可能还要提取信息、调用工具、核对结果,最后整理成一份能交出去的材料。

  更何况,这些活每天都要干,不但要考虑稳定性,还要考虑性价比。

  要满足这些要求,既要继续压低部署和运行成本,也得把干活的能力练扎实。后者,正是Xing4.0-29B-A4B这次重点加强Coding和Agent能力的原因。

  先说Coding。

  过去,百亿参数模型写代码,一个常见的问题就是写个函数、补几行代码还行。

  可一旦把整个代码仓库交过去,要求它解决一个真正的工程问题,事情就没那么顺了。

  因为它需要先看懂项目结构,跨文件追踪接口调用,再结合文档、日志和历史上下文定位问题。改完之后,还得验证修改有没有用,会不会影响其他地方。

  代码只是最后写出来的那一部分,前面还有一长串工作要做。

  针对这个老大难问题,Xing4.0-29B-A4B这次把Coding能力,从「写片段」进一步推向了「干工程」。

  它原生支持256K上下文,并可扩展至512K,让一次任务能够装下更长的代码、文档、日志和历史记录,为理解整个项目提供空间。

  比如,要把分散在Excel里的合同台账做成管控大屏,需要的就不只是一个画图函数。

  

  模型还要理解表格里的业务数据,将合同概览、金额分布、风险识别和履约预警等需求,组织到同一个页面中。

  这里既涉及数据理解,也涉及代码生成和功能组织,需要结合前后的信息完成开发。

  Xing4.0-29B-A4B可以在企业本地,将这些合同台账转化为可视化管控大屏,数据全程不用离开企业环境。

  而到了Agent这边,要求还要再往前走一步。

  理解需求之后,模型得自己拆解任务、安排执行顺序、调用工具,再根据中间结果决定下一步怎么做。

  一路做下去,直到交付一个可以验收的结果。Xing4.0-29B-A4B针对这类长程任务做了专项强化。

  比如,用户一次说清需求后,模型可以判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等不同工具或Agent,把任务继续推进。

500

  但模型自己会干活了,企业就能直接用起来吗?

  还差一步,接进现有工作流。

  企业已经在用的开发工具、Agent框架和部署平台,都得接得上。否则,光是换一套环境,就可能先多出一堆工作。

  为此,Xing4.0-29B-A4B已经针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,降低接入现有开发环境的门槛。

  当然,对于我们开头提到的那批企业来说,还有一个绕不开的现实约束:

  数据不能出域,算力也确实有限。

  所以除了能力升级,Xing4.0-29B-A4B也在继续把部署门槛往下压。

  传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或者价格高昂的A卡。

  经过4-bit量化后,这部分占用可以压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。

500

  而这套轻量化私有部署方案,已经进入了真实生产场景。

  在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息和业务记录全程不出域。

  面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验。

  据悉,目前这套方案的复杂业务办理成功率已经达到90%以上。

  到这里,开头那批企业的需求,才算是终于有了着落:

  消费级显卡能跑,复杂任务能接,工具和业务系统也能连起来。

  那么问题来了,这究竟是怎么做到的?

  架构、数据、训练、部署的全方位优化

  前面提到的MoE,是其中一部分答案。

  模型有290亿总参数,但每次推理只激活约40亿。这样一来,每次处理任务时,就不必把全部参数都调动一遍,计算开销也随之降低。

  但要让它读长文档、写工程代码,再把一个多步骤任务持续做下去,光靠MoE还不够。

  背后还有架构、数据、训练和工程优化几方面的配合。

  先看架构。

  上下文越长,模型能读进去的内容就越多。可问题是,读进去的内容,也要占地方。

  模型处理长文档时,会把前文的一部分计算结果存下来,方便后续生成时复用,这就是大家熟悉的KV Cache。

  随着上下文变长,缓存也会越积越多,吃掉更多显存,还可能拖慢推理速度。

  所以,长上下文要真正用起来,就得先想办法给这份缓存瘦身。

  Xing4.0-29B-A4B采用的MLA多头潜变量注意力,做的就是这件事:把需要缓存的信息压缩成更紧凑的形式,降低长上下文推理的显存开销。

  进一步,读进去的开销降下来了,生成速度也得跟上。在这里,Xing4.0-29B-A4B还采用了MTP,也就是多Token预测。

  相比常规训练主要让模型预测下一个Token,MTP则让模型同时学习预测后续多个Token,从中学习更长的前后关联。

  这些预测还可以在推理时派上用场:先提前生成候选内容,再交给主模型校验,为生成加速提供支持。

  此外,模型还引入了DeepSeek同款的mHC流形约束超连接,约束信息在不同层之间的传递,减少信号反复放大带来的训练不稳定。

  架构搭好了,接下来就看模型学什么。

  中国电信这次自建了一套包含数十万亿词元的数据体系。

500

  预训练数据经过PB级多源清洗,除了通用内容,还加入了复杂表格、结构化知识图谱和智能体行为轨迹。

  其中,行为轨迹和Agent能力的关系尤其直接。因为它记录的,恰好就是一个任务从头到尾怎么做——

  目标是什么,中间调用了哪些工具,工具返回了什么,拿到结果之后,下一步又该如何处理。

  这些过程连在一起,模型才能学习如何把前一步的结果,接到下一步的操作上。

  到了后训练阶段,团队又搭建了支持代码运行、在线搜索和工具调用的高并发沙箱,在其中构造长程Agent任务。

  代码能不能跑,工具有没有调对,最后的结果是否符合要求,都通过测试用例和自动化机制校验。

  这样一来,训练材料该不该留下,就有了实际执行结果作为依据。

  在训练阶段,Xing4.0-29B-A4B则随着任务难度逐步展开。

  预训练从4K序列长度起步,先学习通用知识和基础推理,再逐步提高代码与复杂推理数据的占比。

  进入中训练阶段,序列长度依次扩展到32K、128K和256K,同时增加仓库级代码、复杂推理和Agent数据。

  到了后训练阶段,团队围绕Coding、Agent和Reasoning三个方向,分别开展多专家强化学习,再通过MOPD,把各个方向的专项能力融合起来。

500

  值得一提的是,训练过程中,还用上了Muon和QK-Clip。前者用于优化参数更新,后者控制注意力计算中的数值规模,降低数值异常增长的风险。

  最后,在工程优化阶段,电信进一步让模型能够在国产算力上高效完成训练。

  这也是全栈国产化真正落到技术细节的地方。

  Xing4.0-29B-A4B基于昇腾910C集群,结合MindSpore/MindFormers,完成了mHC等新特性的适配、跨框架精度对齐及融合算子开发,让模型架构、国产训练框架与国产芯片协同起来。

  针对计算调度和显存压力,团队通过DVM图算融合、细粒度重计算和Ascend C定制融合算子,减少调度与数据搬运开销,节省显存,并提高执行效率。

  据官方介绍,经过模型架构、编译、算子与硬件的多层次协同优化,整网训练吞吐较开箱性能提升约96%,接近翻倍。

  后训练使用的Slime强化学习框架,也完成了昇腾生态适配。从训练框架到底层算子,再到强化学习,团队都做了针对性优化。

  也就是说,国芯训国模背后,是芯片、框架、模型和训练流程的整套配合。而从架构、数据、训练到部署,这一整套功夫,最终都落到了企业桌上那些已经堆起来的任务上。

  让企业真正用上AI

  最后,为了让企业真正地、丝滑地用上AI办公,电信这次也同步了一个保姆级套餐。

  希望尽快用起来的企业,可以选择将Xing4.0-29B-A4B预集成到算网一体机,减少环境搭建和安装配置工作,缩短部署周期。

  本地算力紧张时,还可以在满足自身数据管理要求的前提下,通过智算专线调用云端算力,完成弹性扩容。

  而对于采用国产算力的企业,模型还基于智源FlagOS统一开源AI软件栈,打通了多家国产芯片的适配路径,降低跨硬件平台迁移和部署的成本。

  可以说,从一张消费级显卡,到算网一体机,再到云端弹性算力,不同规模、不同技术储备的企业,都有相应的部署路径。

  说到这,还有最后一个问题。

  中国电信为什么要专门做这样一款更轻的模型?

  把29B放回整个星辰系列里看,答案会更清楚。

  此前,中国电信已经布局十亿、百亿、千亿参数模型,并开展万亿参数模型,以及语音、语义、多模态等方向的研发。

  而Xing4.0-29B-A4B补上的,是其中一类很具体的需求:

  本地算力有限,但复杂任务照样要做。

  对于这类需求,中国电信并不陌生,甚至不夸张地说,这类需求可能也只有电信能看到、满足。

  从政务、客服到网络运维,它长期接触大量私有化部署场景。数据能放在哪里,现有设备能承担多少计算,业务流程又有多复杂,都是企业用上模型之前必须解决的问题。

  而这,就为这次轻量模型的设计提供了一个具体的出发点。

  从企业现场的算力成本、数据边界和业务需求出发,确定模型需要多大、哪些能力必须加强,再配上相应的交付方案。

  这条从模型走到企业现场的路径,也对应着中国电信正在推进的云改数转智惠战略,以及算力、平台、数据、模型、应用五位一体智能云体系。

  模型负责理解和执行任务,平台负责接入与编排,算力和网络支撑运行,再由行业应用把这些能力接进具体业务。

  Xing4.0-29B-A4B,就是这套布局中面向轻量化私有部署的一步。

  从国产芯片上训练出来,再适配企业手头的设备和实际工作流,国芯训国模的价值,也就进一步落到了企业能不能用、好不好用上。

  也正因如此,后续星辰系列的更新,也有了更具体的看点:更大的模型能处理多复杂的任务,不同模态能覆盖哪些工作,更轻的模型又能进入多少原本受限于设备和部署条件的企业。

  回到开头,AI办公的竞争还在继续。

  而那些数据不能出域、手头算力有限的企业,也一直有文档要读、有材料要交、有业务要办。

  如今,企业又多了一个把AI用起来的选择。

  下一步,可能就从手头这张显卡开始。

  开源地址:

  GitHub:https://github.com/XingChen-AGI/Xing4.0-29B-A4B

  HuggingFace:https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B

  魔搭:https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B

  Gitee:https://gitee.com/xingchen-agi/xing4.0-29b-a4b

  魔乐:https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B

站务

最近更新的专栏

全部专栏