在 Windows 与 VS Code 中使用 Python 3.12 搭建可复现的 ADTK 项目,并通过依赖检查、异常检测示例和结果图完成端到端验证。
系统梳理 Benchmark 与 Baseline 的定义、区别和关系,并通过技术选型、性能回归、容量规划、生产监控和数据质量等场景说明如何落地。
梳理维度上卷的概念、层级关系与聚合原则,并说明其在 OLAP 和多维分析中的应用。
从用户、账号、设备和匿名标识的边界出发,系统梳理 CanonicalUserId、ID-Mapping 与 Identity Graph 的原理、合并风险、工程实现及主流平台实践。
系统梳理 Active User(AU)的定义与 DAU、WAU、MAU 口径,介绍多维分析、漏斗分析和留存分析的计算方法,以及 AU 在数据模型中的设计原则。
介绍如何通过 CROSS JOIN 和维度组合辅助表灵活生成多维聚合结果,并对比 GROUPING SETS、ROLLUP 与 CUBE 的适用场景。
记录在 Grafana、MySQL 和 Azure 跨时区场景中排查 create_time 展示差异的过程,并梳理 UTC、北京时间、PST/PDT 之间的转换关系与实践建议。
梳理 Hive 执行计划 QueryPlan 与 EXPLAIN 输出的关系,结合 MapReduce Stage、Operator Tree、统计信息和常见 EXPLAIN 用法理解 SQL 执行过程。
梳理 Hive SQL 从客户端提交、HiveServer2 接收、Driver 编译优化,到生成 MapReduce 并提交 YARN 调度执行的完整流程。
总结 HiveSQL 中按分组排名后取对应字段值的常见写法,包括 row_number、rank 等窗口函数的使用场景
↑