【大数据】PySpark 使用 FileSystem 操作 HD

作者: 焰火青春 | 来源:发表于2021-12-26 17:46 被阅读0次

【大数据】PySpark 使用 FileSystem 操作 HD
Java遗漏知识点
pyspark dataframe常用操作
10亿+文件数压测，阿里云JindoFS轻松应对
zeppelin中使用spark sql + pyspark混合
PySpark-数据操作-DStream
PySpark-数据操作-RDD
PySpark-数据操作-DataFrame
PySpark-数据操作-SQL
PySpark机器学习 Machine Learning wit

需求：spark 可以直接使用 textFile 读取 HDFS，但是不能判断 hdfs 文件是否存在，不过 pyspark 可以调用 java 程序，因此可以调用 FileSystem来实现：

# coding=utf-8

from pyspark import SparkContext

sc = SparkContext(appName="check_hdfs_exists")
jvm = sc._jvm
log4jLogger = jvm.org.apache.log4j
logger = log4jLogger.LogManager.getLogger(__name__)

config = jvm.org.apache.hadoop.conf.Configuration()
file_system = jvm.org.apache.hadoop.fs.File.System.get(config)

path = jvm.org.apache.hadoop.fs.Path("hdfs://hacluster/xxxxx")
path_is_exists = file_system.exists(path)

网友评论

本文标题：【大数据】PySpark 使用 FileSystem 操作 HD

本文链接：https://www.haomeiwen.com/subject/dmisqrtx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

【大数据】PySpark 使用 FileSystem 操作 HD

相关文章

【大数据】PySpark 使用 FileSystem 操作 HD

Java遗漏知识点

pyspark dataframe常用操作

10亿+文件数压测，阿里云JindoFS轻松应对

zeppelin中使用spark sql + pyspark混合

PySpark-数据操作-DStream

PySpark-数据操作-RDD

PySpark-数据操作-DataFrame

PySpark-数据操作-SQL

PySpark机器学习 Machine Learning wit

网友评论

延伸阅读

深度阅读

栏目导航

热点阅读