美文网首页
Python 基于pyhive库操作hive

Python 基于pyhive库操作hive

作者: 数据人阿多 | 来源:发表于2024-11-13 16:42 被阅读0次

背景

在大数据处理时,基本都是基于Hadoop集群进行操作,数据相关人员在开发数仓或做临时业务需求时,基本都是利用 hive,写 sql 进行数据处理与统计分析,但是 sql 在处理一些复杂业务逻辑时会比较复杂,本文通过基于 pyhive 操作 hive,把 sql 的查询结果转为 pandas 中的 DataFrame 数据框,用于后续数据分析

pyhive 库类似于pymysql库,都是 Python 中与不同数据库系统进行交互的库。它们都提供了简洁的接口来执行 SQL 查询,处理结果集,以及管理连接

小编环境

import sys

print('python 版本:',sys.version)
#python 版本: 3.6.8 (default, Aug  7 2019, 17:28:10) 
#[GCC 4.8.5 20150623 (Red Hat 4.8.5-39)]

import pyhive

print('pyhive 版本:',pyhive.__version__)
#pyhive 版本: 0.6.3

因是在服务器集群操作,python版本较低

示例

#导入库
from pyhive import hive
import pandas as pd


def generate_sql(table,dt):
    sql = f"""
    select id,split(location,',')[1] as longitude,split(location,',')[0] as latitude
    from {table}
    where dt='{dt}'
    """
    return sql 

# 建立连接
conn=hive.connect(
    host = '10.20.1.1',
    port = 10000,
    auth="CUSTOM",
    database = 'bigdata',
    username='datashare',
    password = 'datashare'
)

# 创建游标
cur =conn.cursor()

# 执行查询
sql=generate_sql('tb_test','20241114')
cur.execute(sql)

#获取列名
cols=[]
for col in cur.description:
    cols.append(col[0])

#把sql结果转换为DataFrame
data = pd.DataFrame(cur.fetchall(),columns=cols)
print(data.head())

#借助pandas对数据进行一些处理
#。。。。。。


#数据保存为Excel
data.to_excel('data.xlsx')

# 关闭连接
cursor.close()
connection.close()

这样通过python一站式对数据进行操作,可以很大程度提升工作效率,后续还可以结合sklearn、pytorch等,对数据进行机器学习等相关操作

历史相关文章


以上是自己实践中遇到的一些问题,分享出来供大家参考学习,欢迎关注微信公众号:DataShare ,不定期分享干货

相关文章

  • python3 windows使用pyhive连接Hive

    背景:工作需要,使用 python 操作 hive sql 查询数据使用。目标:使用pyhive连接上hive,并...

  • python连接hive

    Python连接hive,我使用pyhive。以下安装流程如下:1、创建虚拟环境(也可以不用创建,但建议创建安装)...

  • python读取hive数据最佳实践

    使用pyhive库来连接hive server2提供的对外接口,使用sql语句来对数据进行查询,并处理返回结果。 ...

  • cannot import name TFrozenDict

    在终端里输入下列命令 pip install pyhive[hive] 注意这里要加上[hive]后缀,否则有些关...

  • mysql注入

    说明 语言python 代码基于 tornado框架 数据库是用Navicat操作的 引入python操作SQL的...

  • 使用python操作hive

    使用python操作hive python版本为2.7.5(redhat系统自带) hive版本为1.1.0 连接...

  • Hive 基本操作

    数据库基本操作 ( 和MySQL脚本相似 ): 创建删除库操作 创建删除表操作 hive 特点 Hive不支持修改...

  • Hive DDL

    Hive 库操作 创建数据库 删除数据库 修改数据库信息 数据库信息 Hive 表操作 内部表又称管理表。 Hiv...

  • hive调优实战系列文章-hive数据准备

    本文主要讲解利用python 生成hive数据,主要包括python数据生成,数据上传hdfs,hive建库建表,...

  • 记录一次 hadoop+tornado 简单实践(二) -- h

    hive 数据库操作 hive 支持大部分的 sql 语法,因此熟悉 sql 可以很方便的上手 hive 操作 h...

网友评论

      本文标题:Python 基于pyhive库操作hive

      本文链接:https://www.haomeiwen.com/subject/vordjjtx.html