用户12657240
量化回测数据为什么容易内存爆炸?我用批量K线和Polars重新设计数据管道
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
用户12657240
社区首页
>
专栏
>
量化回测数据为什么容易内存爆炸?我用批量K线和Polars重新设计数据管道
量化回测数据为什么容易内存爆炸?我用批量K线和Polars重新设计数据管道
用户12657240
关注
发布于 2026-08-26 22:31:52
发布于 2026-08-26 22:31:52
20
0
举报
概述
QuantDash 支持通过 start_time 和 end_time 指定时间区间。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
python
量化
#QuantDash
目录
📌 摘要
一、问题场景:我的回测策略还没开始跑,内存已经快满了
二、问题根因分析
1. 数据源返回一份数据
2. Pandas保存一份数据
3. concat的时候产生中间数据
4. 因子计算产生更多中间结果
三、我先尝试过哪些方案?
第一种:增加机器内存
第二种:把所有数据拆成文件
第三种:重新思考数据处理层
四、具体实现:批量获取,而不是循环请求
五、第二步:进入Polars之前先控制字段
六、第三步:Pandas到Polars的转换
七、第四步:不要为了一个因子加载全部历史
八、第五步:用Polars做增量特征计算
九、我还会专门检查数据完整性
十、复权问题同样要进入数据管道
十一、实践效果与避坑指南
第一,内存是否可控
第二,计算是否可复现
第三,数据是否能增量处理
十二、我的三个工程避坑经验
坑一:不要把“内存不够”简单理解成机器内存不够
坑二:不要只优化计算,而忽略数据获取
坑三:不要为了性能牺牲数据正确性
十三、总结与思考
Q&A
Q1:是不是所有历史回测都应该使用增量计算?
Q2:Polars是不是只能处理大数据?
Q3:为什么一定要做数据校验?
Q4:A股数据能和美股、港股一起放进Polars处理吗?
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档