部署/

推理也要放在内网:私有大模型、文档识别按任务上服务器

要数据不出公网,推理就必须在内网。自购或自己能管的机器都行。大模型、文档识别、语音和视频按任务和参数上,不必一上来上最大的。

对话页面位于防火墙内侧、推理仍调用公有云,数据边界并未闭合。若材料不得出公网,文本、视觉与语音推理均须部署于本单位可管控的设备。租赁设备可以使用,权限与存储须由本单位管理,不得将流水与合同提交至公网模型。

智能体运行于普通终端;推理按任务配置,不以公开评测榜单为采购依据。

执行终端与推理节点宜分别规划

智能体负责打开软件、填写草稿并在约定节点中止,普通办公电脑即可承担。推理承担文本理解、文档识别与语音转写,按任务部署于服务器。将二者合并为「必须采购最新加速卡阵列」,是常见的配置偏差。

既有加速卡可继续使用。字段抽取、摘要与填表,小参数模型通常可满足。扫描件处理需增加视觉能力,会议或来电转写需增加语音能力,大批量文档再评估并发与显存。

已有内网模型时,缺口通常在执行层

已部署的 DeepSeek、Qwen 或其他内网模型可以接入。需要补齐的是技能与办事:能否解析当前界面、能否写入、失败时能否中止。模型层与执行层可以并存。若自建编排仅覆盖知识库,执行仍须另行接入。

模型持续迭代,交付须保留升级路径。断网环境的升级经介质进行,规则另行约定。

算力评估的四项输入

任务类型、并发人数、文档形态与既有 GPU 对齐后,方可判断配置是否充足。依据公开评测榜单采购,易造成闲置。视频按视觉模型处理,无需另行采购公网剪辑服务。

费用因任务与硬件差异较大,官网不公布统一价格。周期划分见收费与试点相关文章。