恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

al+大数据每日学习笔记43

  • 首页
  • 资讯中心
  • /
  • al+大数据每日学习笔记43

相关资讯

MCP 协议支持哪两种模式?Local Mode 与 Remote Mode 的 stdio 配置实践 2026/10/1 6:52:53
Codex CLI 安装部署与 API 配置全指南:从报错排查到多端点切换 2026/10/1 6:52:53
Codex CLI 编程智能体实战:上下文、任务拆解与权限控制 2026/10/1 6:52:53

最新资讯

Web 开发者零 AI 基础入门:Skill 开发实战全攻略(TaoToken 统一 Key 接入篇)
MCP系列第五集:从零开始构建MCP工具函数,TaoToken统一Key接入实战
OpenAI Agent 工具全面开发者指南——从 RAG 到 Computer Use:Responses API 与 MCP 实战拆解,把 endpoint 改到 TaoToken
win安装openai codex后,把auth.json改到TaoToken的完整配置指南
Hermes-Agent分层校准部署实战:NPU/GPU/Mac全平台适配
LabelMe与LabelImg快捷键自定义完全指南:从配置文件到高效标注实战

今日推荐

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

al+大数据每日学习笔记43

发布时间:2026/10/1 6:52:53
al+大数据每日学习笔记43 2026年9月30日Hive实战干货常用基础命令高频窗口函数在大数据离线数仓、数据分析、数据开发场景中Hive是企业最常用的核心工具。本文基于企业生产规范整理工作中100%高频使用的Hive基础命令、窗口函数剔除冷门语法聚焦实战落地适合日常开发、面试复盘、新手速查可直接收藏复用。一、Hive企业核心认知Hive是基于Hadoop的数仓工具通过类SQL语法实现离线数据查询与计算底层支持MapReduce、Tez、Spark引擎核心适配海量结构化数据离线分析不支持实时增删改。生产核心核心概念外部表生产首选删除表仅清空元数据HDFS原始数据保留安全性极高企业90%场景使用内部表临时使用删表同步删除元数据HDFS数据仅用于临时测试表分区按日期、区域等字段拆分HDFS目录缩小查询扫描范围是Hive优化核心手段分桶对字段哈希取模拆分文件优化大表Join、数据抽样场景二、企业高频Hive基础命令可直接复用所有命令遵循生产规范携带if not exists、partition等核心参数适配正式环境开发避免报错与数据风险。1. 数据库操作-- 创建数据库规范库名小写、业务关联 create database if not exists dw_business; -- 切换数据库 use dw_business; -- 查看数据库详情 desc database dw_business; -- 删除空数据库 drop database if exists dw_business; -- 级联删除库含表仅测试环境使用 drop database if exists dw_business cascade;2. 数据表操作生产核心企业建表统一使用外部表指定分隔符、存储路径禁止使用默认参数。-- 生产标准建表语句外部表分区制表符分隔 create external table if not exists user_info( user_id string comment 用户唯一ID, user_name string comment 用户名, age int comment 年龄, gender string comment 性别 ) comment 用户基础信息表 partitioned by (dt string comment 数据日期) row format delimited fields terminated by \t stored as orc location /user/hive/dw_business/user_info; -- 查看表结构/详细元数据 desc user_info; desc formatted user_info; -- 复制表结构不含数据常用建新临时表 create table tmp_user_info like user_info; -- 表重命名 alter table user_info rename to user_base_info; -- 新增字段 alter table user_base_info add columns(phone string comment 手机号); -- 删除表生产谨慎操作 drop table if exists tmp_user_info;3. 分区操作日常开发高频分区是Hive查询优化关键日常数据同步、数据修复均需操作分区。-- 查看表所有分区 show partitions user_base_info; -- 新增指定日期分区 alter table user_base_info add partition(dt2026-09-30); -- 批量新增分区企业常用 alter table user_base_info add partition(dt2026-09-29) partition(dt2026-09-28); -- 删除过期分区数据清理核心操作 alter table user_base_info drop partition(dt2026-09-01);4. 数据导入与导出-- 1. 本地文件导入Hive表 load data local inpath /data/local/user_data.txt overwrite into table user_base_info partition(dt2026-09-30); -- 2. HDFS文件导入移动文件非复制 load data inpath /hdfs/data/user_data.txt into table user_base_info partition(dt2026-09-30); -- 3. 查询结果插入表生产数据落地核心 insert overwrite table user_base_info partition(dt2026-09-30) select user_id,user_name,age,gender,phone from tmp_user; -- 4. 数据导出到本地文件 insert overwrite local directory /tmp/hive_export/user_data row format delimited fields terminated by \t select * from user_base_info where dt2026-09-30;5. 基础查询与关联-- 基础查询、条件过滤、去重 select distinct user_id,user_name from user_base_info where age 18 limit 100; -- 分组聚合统计 select gender,count(user_id) as user_num,avg(age) as avg_age from user_base_info where dt2026-09-30 group by gender; -- 左关联企业最常用Join方式 select a.user_id,a.user_name,b.order_num from user_base_info a left join order_info b on a.user_id b.user_id where a.dt2026-09-30 and b.dt2026-09-30;三、企业高频窗口函数数据分析核心窗口函数是Hive数据分析、指标统计的核心区别于普通group by一组一行窗口函数一行输入对应一行输出可保留明细同时实现分组统计、排名、环比等场景。通用语法函数() over(partition by 分组字段 order by 排序字段 窗口范围)1. 排序类函数排名场景TOP1适配场景班级成绩排名、区域销量排名、用户活跃度排序等。函数特性适用场景row_number()连续不重复编号1,2,3,4取TOPN、唯一排序rank()并列跳号1,1,3,4正式排名、竞赛排名dense_rank()并列不跳号1,1,2,3密集排名、档位统计-- 示例按班级统计学生成绩排名 select class_id, student_name, score, row_number() over(partition by class_id order by score desc) as rn, rank() over(partition by class_id order by score desc) as rk, dense_rank() over(partition by class_id order by score desc) as drk from student_score where dt2026-09-30;2. 聚合窗口函数分组统计适配场景明细数据附带分组总和、平均值、极值无需子查询。select user_id, order_amount, -- 分组总交易额 sum(order_amount) over(partition by user_id) as total_amount, -- 分组平均交易额 avg(order_amount) over(partition by user_id) as avg_amount, -- 分组最大/最小交易额 max(order_amount) over(partition by user_id) as max_amount, min(order_amount) over(partition by user_id) as min_amount, -- 分组订单数 count(*) over(partition by user_id) as order_cnt from user_order where dt2026-09-30;3. 前后行取值函数环比、差值计算适配场景日环比、用户行为上下游、价格波动计算等企业高频场景。lag(col,n,默认值)取当前行上n行数据n默认1lead(col,n,默认值)取当前行下n行数据n默认1-- 示例统计每日销售额及前一日销售额、环比差值 select dt, sale_amount, lag(sale_amount,1,0) over(order by dt) as prev_day_amount, sale_amount - lag(sale_amount,1,0) over(order by dt) as diff_amount from daily_sale;4. 首尾取值函数first_value(col)取窗口内第一条数据last_value(col)取窗口内最后一条数据注意默认窗口范围select user_id, dt, order_amount, first_value(order_amount) over(partition by user_id order by dt) as first_order_amount, last_value(order_amount) over(partition by user_id order by dt rows between unbounded preceding and unbounded following) as last_order_amount from user_order;5. 窗口范围控制进阶优化默认窗口order by 后默认「从第一行到当前行」手动指定窗口可实现滚动统计、累计统计。-- 1. 累计求和从分组首行到当前行 sum(amount) over(partition by user_id order by dt rows between unbounded preceding and current row) -- 2. 滚动统计前2行当前行共3行数据 sum(amount) over(partition by user_id order by dt rows between 2 preceding and current row) -- 3. 全窗口统计分组所有行 sum(amount) over(partition by user_id rows between unbounded preceding and unbounded following)6. 分桶百分比函数适配场景数据分层、百分位统计、用户分层高/中/低价值用户。select user_id, consume_amount, -- 将数据均匀分为4桶四分位分层 ntile(4) over(order by consume_amount desc) as level, -- 当前数据百分位 percent_rank() over(order by consume_amount), -- 小于等于当前值的占比 cume_dist() over(order by consume_amount) from user_consume;四、企业开发避坑窗口函数位置限制只能写在select、having中禁止用于where过滤需过滤可嵌套子查询last_value函数坑点加order by后默认仅统计到当前行需手动指定全窗口范围分区必带条件查询分区表必须加分区筛选dtxxx避免全表扫描、任务卡顿杜绝select *生产查询指定所需字段减少数据传输与计算压力数据倾斜处理大表Join、分组字段值集中易倾斜可通过参数调优、拆分数据优化五、核心总结1. 企业Hive开发以外部表分区为核心规范兼顾数据安全与查询效率2. 基础命令优先掌握库表操作、分区管理、数据落地三大类适配日常开发3. 窗口函数是数据分析核心排序、取值、滚动统计三大类可覆盖95%企业指标场景4. 生产环境优先遵循「分区过滤、按需字段、避免全表扫描」三大优化原则。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号