首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >量化回测数据为什么容易内存爆炸?我用批量K线和Polars重新设计数据管道

量化回测数据为什么容易内存爆炸?我用批量K线和Polars重新设计数据管道

作者头像
用户12657240
发布2026-08-26 22:31:52
发布2026-08-26 22:31:52
200
举报
概述
QuantDash 支持通过 start_time 和 end_time 指定时间区间。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 📌 摘要
  • 一、问题场景:我的回测策略还没开始跑,内存已经快满了
  • 二、问题根因分析
    • 1. 数据源返回一份数据
    • 2. Pandas保存一份数据
    • 3. concat的时候产生中间数据
    • 4. 因子计算产生更多中间结果
  • 三、我先尝试过哪些方案?
    • 第一种:增加机器内存
    • 第二种:把所有数据拆成文件
    • 第三种:重新思考数据处理层
  • 四、具体实现:批量获取,而不是循环请求
  • 五、第二步:进入Polars之前先控制字段
  • 六、第三步:Pandas到Polars的转换
  • 七、第四步:不要为了一个因子加载全部历史
  • 八、第五步:用Polars做增量特征计算
  • 九、我还会专门检查数据完整性
  • 十、复权问题同样要进入数据管道
  • 十一、实践效果与避坑指南
    • 第一,内存是否可控
    • 第二,计算是否可复现
    • 第三,数据是否能增量处理
  • 十二、我的三个工程避坑经验
    • 坑一:不要把“内存不够”简单理解成机器内存不够
    • 坑二:不要只优化计算,而忽略数据获取
    • 坑三:不要为了性能牺牲数据正确性
  • 十三、总结与思考
  • Q&A
    • Q1:是不是所有历史回测都应该使用增量计算?
    • Q2:Polars是不是只能处理大数据?
    • Q3:为什么一定要做数据校验?
    • Q4:A股数据能和美股、港股一起放进Polars处理吗?
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档