首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏GiantPandaCV

    INT4量化用于目标检测

    Int4量化与全精度对比 ? 消融实验 ? FreezeBN与不同bit的对比 ? 截断激活函数阈值的百分比 ? 与其他量化方法的对比图

    1.5K20发布于 2021-03-24
  • 来自专栏PostgreSQL研究与原理解析

    PG:INT4 VS. FLOAT4 VS. NUMERIC

    PG:INT4 VS. FLOAT4 VS. NUMERIC 关系型数据库中数据类型是一个重要话题。PG提供很多不同类型,但并不是所有类型都相同。根据需要实现的目标,可能应用需要不同列类型。

    1.6K20发布于 2021-02-03
  • 来自专栏向量搜索-架构选型

    Int4:Lucene中的标量量化更进一步

    在Lucene中引入Int4量化 在我们之前的博客中,我们详细介绍了Lucene中标量量化的实现。我们还探讨了两种特定的量化优化。 现在,int4为我们提供了比之前更多的压缩选项。它将量化空间减少到只有16个可能的值(0到15)。 总的来说,存储带有位压缩的int4比float32小8倍。 图1:这展示了int4所需的字节减少,当压缩时,相比float32可以减少8倍的大小。 int4在评分延迟方面也有一些优点。 图3:Lucene搜索置信区间空间,并测试int4量化的各种桶。 图4:这是为CohereV3样本集找到的最佳int4量化桶。 对于优化过程和此优化背后的数学的更完整解释,请参见优化截断间隔。 Int4给了你调整设置以适应你的用例的机会。 图6:CohereV3 500k向量的速度比较。 结束了吗?

    71921编辑于 2024-05-01
  • 来自专栏AI人工智能

    模型量化大揭秘:INT8、INT4量化对推理速度和精度的影响测试

    模型量化大揭秘:INT8、INT4量化对推理速度和精度的影响测试 Hello,我是摘星! 在彩虹般绚烂的技术栈中,我是那个永不停歇的色彩收集者。 本文将基于我在多个实际项目中的量化实践经验,深入剖析INT8和INT4量化技术的原理、实现方法和性能表现。 INT4量化的极限压缩探索3.1 INT4量化的挑战与机遇INT4量化将模型压缩推向了极限,但也带来了更大的精度挑战:class INT4Quantizer: """INT4量化器 - 实现4位量化 3.2 INT4推理优化实现class OptimizedINT4Linear(torch.nn.Module): """优化的INT4线性层""" def __init__(self, 而INT4量化虽然在精度保持方面面临更大挑战,但其8倍的压缩比和2-3倍的速度提升使其在资源受限场景下具有重要价值。

    3.2K21编辑于 2025-08-20
  • 来自专栏机器之心

    类GPT模型训练提速26.5%,清华朱军等人用INT4算法加速神经网络训练

    在本文中,清华朱军等人提出了一种使用 INT4 算法实现所有矩阵乘法的 Transformer 训练方法。 模型训练得快不快,这与激活值、权重、梯度等因素的要求紧密相关。 Sun 等人成功训练了几个具有 INT4 激活 / 权重和 FP4 梯度的当代网络;Chmiel 等人提出自定义的 4 位对数数字格式,进一步提高了精度。 结合前向和反向传播的量化技术,本文提出一种算法,即对 Transformer 中的所有线性运算使用 INT4 MMs。 并且研究提出的原型量化 + INT4 MM 算子比 FP16 MM 基线快了 2.2 倍,将训练速度提高了 35.1%。 他们改变了隐藏层大小、中间全连接层大小和批大小,并在下图 5 中绘制了 INT4 训练的加速比。

    85520编辑于 2023-08-07
  • 来自专栏机器学习与统计学

    全新大模型开源,腾讯(int4能打DeepSeek) Vs 谷歌(2GB运行多模态)

    Ai 学习的老章 最近除了阿里 Qwen3 模型更新了图片生成和处理能力,大家都可以玩转吉卜力风格 还有几个最近发布的大模型值得关注 1 是腾讯开源了 80B 混元 A13B 模型,亮点是精度无损的 int4 82.7 84.0 AIME 2024 87.3 86.7 Gsm8k 94.39 94.24 BBH 89.1 87.91 DROP 91.1 91.05 这样的话,本地部署,完全可以直接使用 int4 ,我感觉 4 张 4090 就可以跑起来了 https://modelscope.cn/models/Tencent-Hunyuan/Hunyuan-A13B-Instruct-GPTQ-Int4/ int4

    1.2K10编辑于 2025-06-30
  • 来自专栏大模型应用

    大模型应用:大模型量化:INT4与INT8核心差异、选型指南及代码实现.53

    3.1.1 INT4 缩放核心作用:把电子秤的大范围(0~200kg),等比例映射到 INT4 秤的小范围(-8~7)。 )图6:量化误差分析 计算并比较INT8和INT4的量化误差,显示INT4平均误差显著高于INT8,误差分布直方图量化展示差异核心要点:1. INT4 量化实现INT4 量化必须搭配分组校准和双重量化策略,否则精度损失会很大。# 1. :INT4 模型的显存占用约为 INT8 的 50%,FP32 的 12.5%;推理速度:INT4 模型的推理速度是 INT8 的 1.7 倍,FP32 的 5 倍;精度表现:INT4 模型的 PPL ,比普通 INT4 量化精度更高。

    1.6K55编辑于 2026-03-23
  • 《模型量化实战:从 FP16 到 INT4,如何在精度损失 ~1% 的情况下提速 300%?》

    别被"精度掉 1%"骗了——你省的不是"精度",你省的是显存带宽先说一句得罪人的大实话:很多团队做量化,动机是"听说 INT4 能提速 3 倍"。 一、先把世界切开:FP16 / INT8 / INT4 到底在说啥? 友好的 per-channel scaling(不是混合精度),硬件侧更干净(Marlin / CUTLASS INT4 GEMM 能吃得动)。 四、最关键的"反直觉观点":INT4 的 3x 提速,来自带宽,不来自 ALU程序员本能想:4-bit 比 16-bit "少算 4 倍"→ 快 4 倍。 batch 一大就 OOM,不是量化没用undefined别搞反因果:INT4 省权重显存,但 KV cache 才是 batch 的天花板。

    21510编辑于 2026-07-24
  • 来自专栏PostgreSQL研究与原理解析

    执行ALTER TABLE语句时如何避免长时间阻塞并发查询

    # ALTER TABLE test ADD COLUMN whatever int4; ALTER TABLE TIME: 12.662 ms 可以看到该语句执行的非常快,在看下alter table 获取的锁: =# BEGIN; BEGIN =# ALTER TABLE test ADD COLUMN whatever2 int4; ALTER TABLE =# SELECT * FROM (SESSION 2) =# ALTER TABLE test ADD COLUMN whatever2 int4; 会话2执行alter 语句时由于需要等待会话1释放锁被阻塞,但是他已经获取这个表上的 ;\n" SET statement_timeout = 50; ALTER TABLE test add column whatever2 INT4; 超时时间保证alter table语句执行不超过 50毫秒,然后通过psql执行: =$ time printf "SET statement_timeout = 50;\nALTER TABLE test add column whatever2 INT4

    3.2K10发布于 2020-10-28
  • 来自专栏大模型应用

    大模型应用:量化校准:全局/分组 Min-Max、GPTQ、AWQ 算法最优匹配.54

    Q_max:INT4 最大值(15,因 2^4 - 1 = 15);4. round:四舍五入,确保结果为整数(INT4 取值)。 15): INT4值 = (FP32值 - Min) / (Max - Min) * 15步骤 3:推理时,再用反向公式还原:FP32值 = (INT4值 / 15) * (Max - Min) + Min1.3 INT4[1]: 8 -> -9.8 + 8/15 * 20.3 = 1.0267 INT4[2]: 7 -> -9.8 + 7/15 * 20.3 = -0.3267 INT4[3 这是 INT4 量化从不可用到可用的基石。 INT4=11 → 0.0625 权重2: -0.5000 → -0.0419 → INT4=0 → -0.0419 分组2反量化: 权重3: 10.5000 → 0.8793 → INT4=15

    94433编辑于 2026-03-22
  • 来自专栏深度学习与python

    使用 BigDL-LLM 加速 Intel ® 数据中心 GPU 上的 LLM 推理

    作者 | Wesley Du, Yang Y Wang 策划 | Tina 导读:本文探讨了在 Intel® 数据中心 GPU 上采用 BigDL-LLM INT4 和 FP16 (使用 Self-Speculative 例如,低比特(例如 INT4)优化和 Speculative Decoding 等技术为加速 LLM 推理提供了有效的选择。 ,并在幕后使用 INT4 模型作为草稿模型。 Intel® 数据中心 GPU Max 1100C 上的 INT4 推理性能 请参考配置和免责声明以获取配置信息。 Batch size 1, greedy search, input tokens 1024, output tokens 128, data type INT4/FP16.

    91110编辑于 2024-03-26
  • 来自专栏机器之心

    一台3090就能跑Gemma 3 27B!谷歌发布Gemma 3全系QAT版模型

    基于量化感知训练的 Gemma 3 在 AI 模型中,研究者可以使用更少的位数例如 8 位(int8)甚至 4 位(int4)进行数据存储。 采用 int4 量化意味着每个数值仅用 4 bit 表示 —— 相比 BF16 格式,数据大小缩减至 1/4。 但是,这种量化方式通常会导致模型性能下降。 那谷歌是如何保持模型质量的? 这样带来的好处之一是加载模型权重所需的 VRAM 大幅减少: Gemma 3 27B:从 54 GB(BF16)降至仅 14.1 GB(int4) Gemma 3 12B:从 24 GB(BF16)缩减至仅 6.6 GB(int4) Gemma 3 4B:从 8 GB(BF16)精简至 2.6 GB(int4) Gemma 3 1B:从 2 GB(BF16)降至仅 0.5 GB(int4) 此图仅表示加载模型权重所需的 来自 Two Minute Papers 频道的玩笑 官方 int4 和 Q4_0 非量化 QAT 模型已在 Hugging Face 和 Kaggle 上线。

    1.7K10编辑于 2025-04-21
  • 来自专栏猫头虎博客专区

    解决 MyBatis-Plus + PostgreSQL 中的 org.postgresql.util.PSQLException 异常

    有时候会遇到 org.postgresql.util.PSQLException 异常,错误信息为 “conversion to class java.time.OffsetDateTime from int4 Cause: org.postgresql.util.PSQLException: conversion to class java.time.OffsetDateTime from int4 not supported ; conversion to class java.time.OffsetDateTime from int4 not supported; nested exception is 具体来说,数据库中的’ id '列的数据类型是int4(整数),但在映射到Java实体类时,使用了java.time.OffsetDateTime(时间日期)类型,导致转换失败。 修改Java实体类的数据类型: 你可以将对应’ id '列的数据类型修改为int或Long类型,以便与数据库的int4类型匹配。

    3.2K10编辑于 2024-04-08
  • 来自专栏猫头虎博客专区

    PostgreSQL建表语句 INT, INT2, INT4, INT8 分别对应Java,Go, Python什么数据类型?

    PostgreSQL建表语句 INT, INT2, INT4, INT8 分别对应Java,Go, Python什么数据类型 文章目录 PostgreSQL建表语句 INT, INT2, INT4 本文将详细介绍PostgreSQL中的INT, INT2, INT4, INT8数据类型,并解析它们分别在Java、Go、Python语言中的对应关系,帮助大家轻松掌握这些关键知识点。 在本篇文章中,我们将深入探讨PostgreSQL中的整数类型,包括INT, INT2, INT4, INT8,并详细说明它们在Java、Go和Python中的对应数据类型。 INT4:标准整数类型,占用4字节。 INT8:大整数类型,占用8字节,适用于需要存储大范围整数的情况。 常见问题解答(Q&A) Q1: PostgreSQL的INT和INT4有什么区别? A1: 在PostgreSQL中,INT和INT4是同义词,都是4字节的标准整数类型。

    7.6K10编辑于 2024-05-14
  • 来自专栏PostgreSQL研究与原理解析

    使用INT4/INT类型替换INT8/BIGINT类型能够节省多少磁盘空间?

    使用INT4/INT类型替换INT8/BIGINT类型能够节省多少磁盘空间? 最近有人在IRC,Slack和Reddit上讨论使用int4/integer替代int8/bigint能够少4个字节。 如果有2个int4的列,他们将8字节对齐,仅使用这一个8字节。 我们通过简单测试来看,仍在64位机器上: $ create table test as select i::int4 as i1, i::int4 as i2 from generate_series( 现在让我们看看当我创建一个包含 int4 + int8 列的表时会发生什么。 所以在某些情况下,使用int4/int2是有益的。可以通过使用较小的数据类型来节省一些磁盘空间,但是差异并没有那么大。需要仔细规划。

    1.2K40编辑于 2022-03-29
  • Gemini 3.5 端侧部署工程实践:Nano 模型量化策略、NPU 加速与性能优化方案

    Gemini 3.5 Nano 是 Google 专为端侧设备设计的轻量级大语言模型,INT4 量化后模型体积约 1.2GB,在骁龙 8 Gen 3 上实测首 Token 延迟 280ms、生成速度 32 一是 INT4 量化,将模型参数从 FP16 压缩到 4-bit,体积缩小约 75%,推理速度提升约 2-3 倍。 INT4 量化精度损失约 2%-5%,速度快约 2-3 倍,是 Gemini 3.5 Nano 的默认方案,适合大多数端侧场景。 混合精度量化对不同层采用不同精度——注意力层保持 INT8,FFN 层压缩到 INT4,精度损失约 1.5%-3%。 Q2:INT4 量化的精度损失大吗? 约 2%-5%。在日常对话、文本摘要等场景中几乎感知不到,在数学推理和代码生成场景中可能有轻微影响。Q3:端侧能处理多长的上下文?

    52610编辑于 2026-06-22
  • 来自专栏程序那些事

    JVM系列之:从汇编角度分析Volatile

    我们可以看到在设置值的过程中是和java源代码的顺序是一致的,是按照int1,int2,int3,int4,int5的顺序一个一个设置的。 从生成的代码中,我们可以看到putstatic是按照int1,int5,int4,int3,int2的顺序进行的,也就是说进行了重排序。 如果我们将int2设置成为Volatile,看看结果如何? 我们不是需要设置int1,int2,int3,int4,int5 5个值吗?这里怎么只有3个。 有了这些寄存器的值,我们再继续往下看,从而可以知道,第二个红框实际上表示的就是putstatic int1,而最后一个红框,表示的就是putstatic int4。 注意,上面的最后一个红框表示的是putstatic int4

    82841发布于 2020-08-10
  • 来自专栏Hadoop数据仓库

    HAWQ与Hive查询性能对比测试

    , day_of_week_no int4, status_code_dim( status_cd varchar(100), client_error_flg int4 set search_path=public; create table date_dim( cal_dt date, day_in_cal_yr_no int4 , day_of_week_no int4, start_of_month_dt date, start_of_quarter_dt date, start_of_week_dt status_code_dim( status_cd varchar(100), client_error_flg int4

    1.5K60发布于 2018-01-03
  • 来自专栏贾志刚-OpenCV学堂

    OpenVINO2025+QWen2.5-VL多模态大模型应用演示

    output_dir> 需要安装一下NNCF这个工具, pip install nncf -i https://pypi.tuna.tsinghua.edu.cn/simple 帮助把大模型压缩量化支持INT8、INT4 /qwen2.5_3b qwen2.5_3b/INT4 --task image-text-to-text --weight-format int4 官方文档给出转换命令行 没有--task参数会导致转换时候报错 转换之后生成INT4格式的qwen2.5-openvino格式文件 推理SDK与演示 首先需要安装QWen API工具支持包 pip install qwen-vl-utils[decord] 安装好以后 OVModelForVisualCausalLM min_pixels = 256 * 28 * 28 max_pixels = 1280 * 28 * 28 model_dir = "D:/LLMs/qwen2.5_3b/INT4

    32600编辑于 2026-04-02
  • 来自专栏10km的专栏

    opencl:kernel中两种向量类型转换(convert_T,as_typen)的主要区别

    0x00000002,0x00000004);与原数据相比,向量元素类型数据长度从1个字节扩展成了4个字节 对于向量类型来说,”显式转换”方式要求就是源类型和目标类型的元素个数必须是一样的,就是说,不允许将int4 uint u = as_uint(f); // 合法. u为: 0x3f800000 float4 f = (float4)(1.0f, 2.0f, 3.0f, 4.0f); // 合法. i为: (int4 )(0x3f800000, 0x40000000, 0x40400000, 0x40800000) int4 i = as_int4(f); float4 f, g; int4 is_less = f f[i] : 0.0f f = as_float4(as_int4(f) & is_less); int4 i; // 合法. int4为16字节 short8也是16字节 short8 j = as_short8

    2K31发布于 2019-05-25
领券