资讯动态

大数据开发学习Day32

发布时间:2026/8/22 11:28:48 来源:尧图企业网站定制
一、Linux查看当前目录磁盘占用大小分页查看大文件 big.log过滤当前目录下所有 .txt 文件du-shlessbig.logls|grep.txt$du -sh 查看目录总大小快速定位磁盘占用大户less 分页查看文件比 vim、cat 更适合看大日志正则 $.txt 匹配以 txt 结尾文件过滤指定后缀二、SQL1757. 可回收且低脂的产品SELECTproduct_idFROMProductsWHERElow_fatsYANDrecyclableY;多条件 AND 精准筛选标签型字段组合过滤用户画像、商品标签圈选基础模板1795. 每个产品在不同商店的价格SELECTproduct_id,store1ASstore,store1ASpriceFROMProductsUNIONALLSELECTproduct_id,store2ASstore,store2ASpriceFROMProductsUNIONALLSELECTproduct_id,store3ASstore,store3ASpriceFROMProducts;UNION ALL 列转行经典写法宽表转长表数仓建模、拉链表、宽长互转必考手动构造维度列适配多门店、多渠道拆分1873. 计算特殊奖金SELECTemployee_id,CASEWHENemployee_id%21ANDnameNOTLIKEM%THENsalaryELSE0ENDASbonusFROMEmployeesORDERBYemployee_id;取模 % 判断奇偶LIKE ‘M%’ 前缀模糊匹配CASE 多规则分支计算衍生字段薪资核算、补贴规则类 SQL 通用套路三、Pysparkfrompyspark.sqlimportSparkSessionfrompyspark.sql.functionsimportcol,lit,when sparkSparkSession.builder.master(local[*]).appName(Day32).getOrCreate()# 1. 同时低脂可回收prodspark.createDataFrame([(1,Y,Y),(2,Y,N)],[product_id,low_fats,recyclable])prod.filter((col(low_fats)Y)(col(recyclable)Y)).show()# 2. 宽表转长表 行转列dfspark.createDataFrame([(1,100,200,150)],[product_id,store1,store2,store3])df1df.select(product_id,lit(store1).alias(store),col(store1).alias(price))df2df.select(product_id,lit(store2).alias(store),col(store2).alias(price))df3df.select(product_id,lit(store3).alias(store),col(store3).alias(price))df1.unionAll(df2).unionAll(df3).show()spark.stop()Spark 多条件过滤用 条件加括号lit() 构造常量字段对应 SQL 手写字符串unionAll 实现宽表拆分成多行和 UNION ALL 逻辑一致四、算法125. 验证回文串defisPalindrome(s:str)-bool:s.join(ch.lower()forchinsifch.isalnum())returnss[::-1]只保留字母数字、统一转小写切片反转字符串直接对比字符串预处理 回文判断面试基础高频题

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价