数据湖是一个集中式存储池,可对接多种数据源,无缝对接各种计算分析和机器学习平台
数据落到对象存储,组织成 Iceberg 表,再由 Spark、Flink 等计算引擎读写。相比直接管理大量文件,Schema、Snapshot、分区和表版...
一张原本只用于分析查询的主题表,最开始可能只有一个报表在用。后来脚本、任务陆续接上来,等再准备改字段时,往往要先确认还有谁在用。一条临时验证的 SQL 也可...
一张表已经很少有人查询,任务还在每天跑。一个专题结束了,相关数据还在持续更新。准备调整一个字段,往下查才发现几个报表和接口都直接依赖它。
这几年再看 OLAP 数据库,一个比较明显的变化是,大家讨论的问题已经和几年前不太一样了。
分析型数据库的性能比较,最终还是要回到真实 Query 和实际运行数据。我们基于 Apache Doris 4.2 与 StarRocks 4.1.1,在相同计...
腾讯云TDP | 产品KOL (已认证)
数据湖看似强大,但实际使用中容易踩坑。本文分享真实经验,探讨如何避免数据湖带来的麻烦。
导读:Apache Doris 5.0 多模湖仓预告(3)|生产实践篇:快手在生产环境用 Apache Doris 直接查询 Apache Paimon 表上的...
作者|李文强,Apache Doris PMC 成员、SelectDB 多模湖仓负责人
过去十多年,数据平台主要围绕结构化表与 SQL 建设:把数据汇聚到数仓,通过稳定的批处理和 OLAP 查询支撑报表与经营分析。
2026 年,全球用于 AI 工作负载的对象存储采购量同比增长 75%,对象存储已成为 AI 训练数据湖的核心底座。本文从数据湖架构设计、存储选型、性能优化与成...
数据湖不是万能钥匙,但可能是你最需要的那把
7月25日,腾讯云正式发布智能数据湖计算平台AI DLC,面向自动驾驶、具身智能、Agent等AI场景,提供覆盖数据处理、训练、推理到 Agent 应用的一体化...
腾讯云大数据将正式发布智能数据湖计算 AI DLC——国内首个在同一平台上同时提供生产级 Spark + Ray 全托管服务的智能数据湖计算平台。一份算力同时承...
2026年6月29日,OceanBase发布面向AI时代的湖库一体AI数据库。一周后,Databricks在2026 Data + AI Summit上宣布推出...
未来,随着数据湖与数据库界限的模糊,PostgreSQL作为“统一查询引擎”的角色将愈发重要。这套组合正是这一趋势的先行者。
还在忍受数据湖只读不写的痛点?DuckDB-Iceberg v1.4.2全面颠覆!我们实现了Iceberg表的ACID全支持:插入、更新、删除,都在事务中保持一...
传统的基础设施即代码(IaC)方案,比如 Amazon CloudFormation 或 Terraform,大量依赖 YAML 或 JSON。这些声明式语言虽...
数据湖构建是企业实现海量数据统一存储与分析的关键步骤。本文介绍基于腾讯云弹性 MapReduce ( EMR )的数据湖构建方案,结合 Apache Icebe...