## 几个概念总参数量 = 词嵌入层参数 + 解码器层参数小模型 就是在参数量上显著小于LLM的模型所有参数 都放在 safttensors 模型文件 中预训练 就是为了 生成合理的 参数值后训练 也是为了 生成合理的 参数值蒸馏、微调、强化学习,都是后训练大模型变成小模型采用"蒸馏+量化+剪枝"的组合策略 一、大模型 GPT-3 参数量详解大模型的参数量是指神经网络中所有可训练权重和偏置的总数,这些参数决定了模型的学习能力和表达能力 输出层输出层为线性层,将隐藏向量映射回词表概率,参数量与词嵌入层完全一致(共享权重是主流大模型的优化方式,若不共享则单独计算,结果相同)。 三、大模型、小模型参数差距的本质大模型的参数量,本质上是用 dmodel2d_{model}^2dmodel2 的代价,换取高维语义空间的表达能力。 这就是为什么我们在做 RAG 或 Agent 时,如果任务简单(如分类、提取),坚决不用大模型,因为又慢又贵。Phi-3 为什么只有 3.8B?
控制输出长度的参数 控制所使用的生成策略的参数 用于操作模型输出 logits 的参数 定义“generate”输出变量的参数 可以在生成时使用的特殊字符
PEFT,全称是 参数高效微调 (Parameter-Efficient Fine-Tuning),是一套用于调整大型预训练模型(如大语言模型LLM)以适应特定下游任务的方法论,其核心思想是在 极小化计算和存储资源 1 核心原理 PEFT的底层逻辑基于一个重要的观察和假设: 大模型适应新任务所需的参数变化,其“内在维度”其实很低 。 2 主要方法分类与技术详解 目前主流的PEFT方法可以根据其修改模型的方式分为三大类: 分类 核心思想 代表技术 通俗比喻 添加式方法 冻结原始模型,添加新的、小型的可训练模块或参数 Adapters, QLoRA :LoRA的进化版, 结合了4-bit量化技术 ,进一步将模型的基本权重压缩,使得在单张消费级GPU(如24GB显存)上微调650亿参数的大模型成为可能。 3 PEFT的主要作用与优势 PEFT之所以成为大模型应用的关键技术,是因为它解决了全量微调的几大痛点: 极大降低硬件门槛 :由于需要计算和存储梯度的参数极少,对GPU显存的需求大幅下降。
一、引言 这里的Transformers指的是huggingface开发的大模型库,为huggingface上数以万计的预训练大模型提供预测、训练等服务。 你可以直接使用一个框架训练你的模型然后用另一个加载和推理。 本文重点介绍如何打印微调参数,以及微调参数占比计算。 二、计算微调参数占比 2.1 概述 基于LoRA进行模型微调时,需要先冻结全部参数,再指定相应的Linear层进行微调,那么如何计算全部参数,如何计算微调参数以及如何计算微调参数占全部参数的比例呢? 2.2 模型参数结构一览 这里以Qwen2为例,在微调前,对大模型结构有所认知,对于QLoRA量化微调算法来说,只微调大模型的线性层(Linear层),后面会看到在LoRAConfig中,仅指定了"q_proj 计算参数数量: 对于每个参数,通过param.numel()计算其元素数量(即参数的大小),并累加到all_params以得到模型的总参数数。
它打破传统全量微调的局限,只对模型中少量参数进行调整,就能让模型在特定任务上表现出色,大大降低了大模型在不同任务适配过程中的资源门槛。 这也是低秩适应技术在大模型优化中广泛应用的核心原因。 2,LoRA微调策略 • 传统的全量微调策略 预训练好的模型,其权重矩阵为 ,维度是 。 此外,大模型权重更新具有“低内在秩”的特征,并非所有的参数都需要调整,更新方向集中在少数主要成分上。因此LoRA通过低秩分解来模拟参数的改变量。 在大模型的自注意力层,可训练的参数有四个 ,通过变化矩阵的秩 r,保持可微调的参数总量为18M,分别在两个任务上进行测试。 实验发现在参数矩阵 ,进行LoRA微调,即使矩阵的秩 r=1也取得了和大秩矩阵 r=64 一样的效果。
一、参数散存技术的核心思想与架构基础 参数散存技术是DeepSeek大模型实现高效计算与资源优化的核心创新之一。其核心理念在于通过动态分配与选择性激活模型参数,减少冗余计算,提升资源利用率。 1.1 混合专家架构(MoE)的动态参数激活 DeepSeek采用MoE架构实现参数的物理分散与逻辑集中。在模型结构中,每个前馈网络层被替换为由多个独立专家子网络组成的MoE层。 这种设计使得总参数量达6710亿的模型,在单次推理时仅需激活370亿参数,显著降低了计算复杂度。 知识蒸馏:通过教师-学生框架将670B参数模型的能力迁移至7B小模型,在保持90%性能的前提下实现参数量级压缩。 绿色计算实践:目标在1W功耗下运行10B参数模型,当前原型机已实现70%能效目标。 DeepSeek的参数散存技术标志着大模型设计从"规模至上"到"效率优先"的范式转变。
深度解析大模型微调技术与最佳实践 大模型微调技术演进 ├── 传统阶段(2017-2020): 全参数微调,资源消耗巨大 ├── 发展阶段(2021-2022): 早期参数高效方法(Prefix-Tuning 2025年,大模型微调技术已经从早期的全参数微调发展到如今以LoRA、QLoRA为代表的参数高效微调方法,以及多种技术融合的复杂策略。 1.1 微调的基本概念与原理 大模型微调是指在预训练大模型的基础上,使用特定领域或任务的数据进行进一步训练,使模型更好地适应目标场景的技术过程。 模型规模影响 小模型(≤1B):全参数微调和参数高效方法差异较小 中模型(1B-10B):LoRA/QLoRA开始显现优势 大模型(10B-70B):LoRA/QLoRA成为主流选择 超大模型(>70B 微调即服务(MFTaaS)的兴起将进一步降低大模型应用的门槛,使得更多组织和个人能够利用大模型技术创造价值。
大模型参数量和效果的关系,藏着“边际效益递减”的底层逻辑。盲目追大参数,只会白白浪费算力和存储成本。今天我们就把这个问题讲透,我们怎么去找到效果够用、成本最低的最适合我们业务场景的模型。 模型参数量定义:大模型中可学习的参数总数,类比为模型的知识储备量”。简单理解:参数是模型训练时调整的变量,比如神经网络中的权重、偏置。 对应大模型参数量,把 “喝水” 换成 “给模型加参数量”,“解渴” 换成 “模型效果提升”:模型从 1B→7B(投入:加 60 亿参数):效果从 “磕磕绊绊” 变成 “流畅回答”,好处超大(就像第一杯水 对大模型来说,就是参数量加到一定程度,再堆参数就是白费力气、浪费了重要的资源,找到那个 “加参数最划算” 的临界点,才是关键。 模型中的对应关系:小模型→中等模型:参数量增加,效果显著提升(高边际效益);中等模型→大模型:参数量增加,效果提升放缓(边际效益递减);大模型→超大模型:参数量增加,效果几乎不变甚至下降(负边际效益)。
---- 新智元报道 编辑:好困 David 【新智元导读】搞大模型,什么最重要?突破天际的参数规模?不差钱的海量算力?还是一刷再刷的SOTA?这些可能都不是! 这个模型体系,包含学习了足够多数据与知识的基础大模型,面向常见AI任务专门学习的任务大模型,以及引入行业特色数据和知识的行业大模型。 基础大模型具有学习的数据、知识量大、参数规模大特点,通用性最高。 不过,无论大模型的性能有多强,参数量如何突破天际,最终还是要看它在哪个领域真正发挥作用,看它能给千千万万从业者和普通人带来什么实际便利。 巨大的参数规模,以及不同模型和算力平台之间的差异,给训练带来了极大的挑战。 这是全球首个知识增强千亿大模型,参数规模达到2600亿,是当时全球最大中文的单体模型,在60多项任务中取得了SOTA。
最近,老婆刷到一条新闻:“科学家调整超参数让大模型智商飙升!”她一脸懵地问我:超参数是超级英雄的密码吗?难道AI模型还要输作弊码? 超参数的本质想象一下,超参数是调制AI鸡尾酒的配方比例。数据是基酒,模型结构是酒杯,而超参数决定了“加多少冰块、摇多久、柠檬汁滴几滴”。核心不是改变原料,而是激发最佳风味。 但放任自流会酿成三大惨剧:走火入魔:学习率太高时,模型像饿鬼吞饭,把噪声当真理。比如看图学动物,会把“树叶影子”当成斑马条纹特征。 超参数的秘诀顶级AI工程师调超参数,像指挥交响乐般精准控制三大主旋钮:1. 学习率(油门深浅)太大:模型在知识悬崖上蹦极,一步跨过正确答案。适中:像考古学家用小刷子清理文物,逐步逼近真理。 超参数的局限但超参数调整不是点石成金术,仍有三大难题:玄学炼丹:最佳组合往往靠直觉和经验,就像中餐菜谱里的“盐少许”。同一组参数换到医疗AI上,可能从神医变庸医。
引言 在大模型的应用中,参数调优是连接模型潜力与实际效能的关键桥梁。与传统的软件参数不同,大模型的生成参数更像是一组精密的调控旋钮,它们不改变模型的基础知识,而是影响模型如何思考和表达。 理解这些参数的本质,不仅能够提升模型输出的质量,更是将大模型从玩具转变为工具的关键一步。 今天我们将从理论基础到实践应用,全面解析大模型的核心参数体系,详细的介绍大模型推理中常用的参数项,并通过本地模型示例展示参数调整对模型效能的影响。常见参数项:max_length:生成文本的最大长度。 Dict, Anyimport pandas as pdfrom modelscope import snapshot_downloadclass ModelParameterTester: """大模型参数测试器 分步调优流程图五、总结 大模型的参数调优本质上是在控制与释放之间寻找平衡的艺术。
机器之心报道 编辑:蛋酱、杜伟 当人工智能已进入「大数据 + 大算力 + 大模型」时代,拥有 1.75 万亿参数的「悟道 2.0」,如何延续暴力美学的奇迹? 它以 1.75 万亿参数量打破了此前谷歌 Switch Transformer 预训练模型创造的 1.6 万亿参数记录,成为了全球最大的预训练模型。 1.75 万亿参数,全球最大预训练模型「悟道 2.0」问世 2020 年 5 月,OpenAI 发布了拥有 1750 亿参数量的预训练模型 GPT-3,它不仅能够写文章、答题、翻译,还具备多轮对话、敲代码 2021 年 1 月,谷歌大脑又发布了提出了 Switch Transformer 架构,将语言模型的参数量扩展到了 1.6 万亿,又一次刷新了大模型的参数纪录。 高效微调:世界首创多类别 Prompt 微调,只需训练 0.001% 参数即可实现下游任务适配; 高效推理:世界首创低资源大模型推理系统,单机单卡 GPU 即可以进行千亿参数规模的模型推理。
背景 我们了解相关的专业术语,其实利于大模型业务推广,尤其是一线推广过程中,能够提高专业度和客户依赖性。 大模型命名 模型名称的定义通常会包含一系列信息,以帮助用户快速了解模型的关键特性 一、模型架构差异 基础能力维度 Qwen2.5-72B作为720亿参数规模的纯文本大语言模型(LLM),其核心优势在于复杂语义理解和长文本生成能力 大模型参数规模(DeepSeek-r1和qwen3为例) 参考:https://ollama.com/library/deepseek-r1 参考:https://ollama.com/library /qwen3 小结: 大模型参数的数量,则类比人类大脑本身的成长和成熟。 671B参数数量:这些一般指参数的个数,B是Billion/十亿的意思。 参数:是指模型内部通过海量数据学习获得的数学权重和连接关系,直接决定模型的认知能力和任务处理性能。
最新的 GPT4 模型估计有数万亿个参数,需要数月的时间来训练 。从历史上看,研究人员寻求通过优化并行化策略,复杂的调度,高级压缩来提高分布式DNN训练和推理的性能,甚至网络拓扑本身的重新配置。 这些LLMs代表了具有公开可用参数的尖端语言模型。 对于数据并行性,分层 AllReduce 算法进一步将通信划分为两个阶段,其中第一阶段跨 HB 域同步参数,而第二阶段在 HB 域内同步参数。该算法确保第二级承载更多流量,以更好地利用可用带宽。 我们用数学模型参数化我们的设计,并提出一套全面的指南来确定此类集群的参数。 3.1 Rail-only 网络设计 我们提出了一种网络架构,可以跨所有 GPU 的any- to-any范式。 此外,虽然批量大小参数通常是以 ML 为中心的优化指标,但我们的分析表明批量大小对综合训练性能的影响超出了收敛所需的迭代总数。
语言模型的规模一直在变大,PaLM 有 540B 参数,OPT、GPT-3 和 BLOOM 有大约 176B 参数,模型还在朝着更大的方向发展。 这些模型很难在易于访问的设备上运行。 该方法不仅为异常值对模型性能的影响提供了新思路,还首次使在消费级 GPU 的单个服务器上使用非常大的模型成为可能,例如 OPT-175B/BLOOM。 方法简介 机器学习模型的大小取决于参数的数量及其精度,通常是 float32、float16 或 bfloat16 之一。 这使得 FP16 数字的可表示范围远低于 FP32,面临溢出(试图表示一个非常大的数字)和下溢(表示一个非常小的数字)的风险。 但是集成到 Hugging Face Transformers 和 Accelerate 库中的 LLM.int8(),是第一种即使对于带有 176B 参数的大型模型 (如 BLOOM) 也不会降低性能的技术
丹尼尔:蛋兄,我前几天刷到一个知识点——现在大模型的参数,训练后保存下来基本都是BF16格式。也就是说,一个数字只用16个bit来存?16位是怎么存的?BF又是什么意思?我脑子里全是问号! 模型训练用的是FP32(32位浮点),指数位有8位。而FP16才5位。保存时如果使用FP16,那肯定会各种溢出,就好比蛇吞象一样丹尼尔:那BF16怎么解决?
一、大模型参数反向拆解1. 大模型应用的痛点 当前大模型已从通用能力时代走向专用能力时代,各自凭借万亿级参数实现了文本生成、逻辑推理、多模态理解等通用能力,但在垂直领域中,通用大模型存在能力冗余、推理效率低、成本高昂 传统大模型优化方式分为两类:1. 全参数微调,即对模型所有参数进行重新训练,耗时耗力且容易破坏模型原有通用能力,出现灾难性遗忘;2. 二、大模型参数基础1. 大模型的核心构成 参数是模型的大脑细胞,大模型本质是深度神经网络,核心由“Transformer架构+海量参数”组成,参数是模型的核心资产,分为两类:权重参数(Weight):神经网络中神经元之间的连接强度
大模型的预训练需要耗费巨量的计算资源和数据,因而预训练模型的参数也正成为各大机构重点保护的核心竞争力和资产。 这使得无论是基于模型输出还是基于模型参数,都很难判断某一模型是否是基于另一现有模型微调得来。 因此,对大模型参数的保护是一个尚缺乏有效解决方案的全新问题。 这种直观的方法使公众能够轻松辨识不同大模型之间的联系,并通过这些指纹追踪到模型的基模型,有效预防模型的盗版和滥用。值得注意的是,大模型的制造商无需公布其参数,仅需公开不变项用于生成指纹。 相反,对于从新开始训练的大模型,其参数方向将与其他基模型完全不同。 从下图表中可见,模型的性能随着余弦相似度的下降迅速恶化。这说明,想要在不损害基模型能力的情况下偏离原参数方向是相当困难的! 目前来看,大模型的参数向量方向成为识别其基模型的一个极为有效且鲁棒的指标。
一、前言 接触大模型这么久大家应该都有过这样的经历:为了让大模型生成符合预期的内容,反复修改Prompt,调整用词、句式、参数,耗费数小时甚至数天,最终效果却依然不尽如人意? 、句式,或模型的单个参数,如 temperature=0.7 中的 0.7;适应度:大模型根据该 Prompt或参数生成结果的“好坏程度”,直观可量化;选择:从种群中挑选适应度高的个体(优质 Prompt 大模型在 GA 中的核心角色在“GA + 大模型”的组合中,大模型并非被动的"工具",而是核心的"评估者"和"反馈者",具体承担两个关键角色:适应度评估器:GA生成的每一个 Prompt或参数组合,都需要大模型执行生成任务 执行生成任务:调用大模型 API,传入当前 Prompt 和参数,获取生成结果;2. 总的来说,GA + 大模型的本质是“用遗传算法的进化思想搜索最优 Prompt或参数,用大模型作为评估器量化结果好坏”,核心流程为“初始化种群→大模型评估适应度→选择→交叉→变异→迭代进化→输出最优解”
模型的参数数量通常被视为模型能力的一个重要指标,更多的参数意味着模型有更大的能力来学习、存储和泛化不同类型的数据。 以下是这种关系的几个关键点: 学习能力:参数数量越多,模型学习复杂模式的能力通常越强。这意味着大模型能够理解和生成更复杂的文本,更准确地执行特定任务。 泛化能力:尽管大模型在特定任务上的表现可能更好,但它们也有过度拟合的风险,特别是在训练数据有限的情况下。然而,实践中发现,通过适当的训练技巧和正则化方法,大模型往往能在多个任务上泛化得更好。 适应性:大模型因其庞大的参数规模,有时可以更容易地适应新任务,无需从头开始训练。通过微调,即在特定任务的数据上进行少量的额外训练,这些模型可以快速适应并表现出色。 然而,参数数量的增加也伴随着计算资源的显著增加。这包括训练时所需的计算能力、训练过程中消耗的能源以及模型推理时的延迟。因此,在设计和部署大语言模型时,需要权衡模型性能和计算成本之间的关系。