一体机启动时,管理平台根据预设配置将指定的大模型参数加载至GPU/NPU显存中。对于参数规模较大的模型,系统可采用模型并行或流水线并行技术,将模型参数分布到多个加速芯片上协同运行。加载完成后,推理引擎进入待命状态,准备接收用户请求。
用户通过API接口或图形化界面提交推理请求后,请求首先进入推理引擎的调度队列。系统对输入文本进行分词和向量化编码,然后将编码结果送入大模型进行前向计算,生成响应内容的Token序列。在推理过程中,系统可利用KV Cache技术缓存中间计算结果,显著提升多轮对话场景下的响应速度。
当企业需要使用私有数据对模型进行微调时,一体机首先进行数据预处理,包括数据清洗、格式转换和标注(如需要)。随后系统根据微调策略(如全参数微调或参数高效微调PEFT)配置训练任务,启动分布式训练作业。训练过程中,平台实时监控 loss 曲线、GPU利用率等指标,训练完成后将优化后的模型权重保存至存储系统,并自动注册到模型管理服务中。
一体机的资源调度平台持续监控各硬件资源的使用状态。当多个训练或推理任务并发执行时,调度器根据任务优先级、资源需求和当前系统负载,动态分配计算单元和内存空间。对于训推一体设计的一体机,训练任务和推理任务可在同一资源池中按需切换,提升整体算力利用率。