100%让你在10分钟内学会如何用Python将数据批量的插入到数据库

林德强之原创

2020-08-13

我是一名挣扎在编程链底端的pythoner，工作中既要和数据打交道，也要保持和erp系统，web网站友好的"沟通"···，我会时不时的分享下工作中遇到那点事，包括个人觉得值得记录的编程小技巧，还有就是遇到的问题以及解决方案，还有源码的阅读等等，可能也有编程中的生活感悟，不说了，我要去重构我的程序了

本文基于python, 使用pandas, pymysql等三方库实现了向数据库中高效批量插入数据，一方面提供被网上很多瞎转载的答案给坑蒙了的人(因为我也是)，一方面自己也做个笔记，以后方便查阅

需求原因

最近在处理一个需求，有关批量往数据库插入数据的，描述如下

原来的程序是基于sql的存储过程进行数据的更新修改操作，由于数据量较大，导致对数据库压力太大，于是需要将程序重构为用python读取文件的方式将数据做计算处理，减少这部分的压力，最后仅仅将计算的结果调用aws的lambda服务重新更新到数据库中就可以了，减少了极大的压力，也降低了成本。涉及数据库主要是插入及更新操作

版本库信息

基于linux系统写的
三方库 >>> pandas 1.0.5, pymysql 0.9.3
python版本 >>> 3.7
标准库 >> os

逻辑梳理

实际上，最后一步，要写入数据库的文件数据是存储在内存中的。因为读取文件后进行的计算都是在内存中进行的，那么计算的结果也没必要再写到本地，再去读取，再写入数据库,这是会影响程序的效率的。逻辑如下

读取文件
文件的拼接及计算，生成新的df
初始化数据库的连接
将df所需数据转换为元组数据(取决于数据库的三方库的接口是如何支持批量操作的)
将数据写入数据库
检查数据库内容即可

分步实现及分析

读取文件

给文件路径，然后去读文件就行了，强调一下需要注意的点

绝对路径: 这种最简单，直接给路径字符串就行了，但是一旦文件夹目录结构变化，就需要频繁的改
相对路径: 我一般喜欢先在脚本中定位当前脚本的位置，然后通过相对路径去找，这样只要你整个包内部的目录结构不变化，都不用改，就算部署上线也是直接根据包的位置来，很方便
pandas默认会将所有数字读取为float类型，所以对于那种看起来是数字，但实际上是需要当作字符串使用的字段进行类型的转换

import pandas as pd  
import numpy as np 
 
# 当前脚本的位置 
current_folder_path = os.path.dirname(__file__) 
 
# 你的文件的位置 
your_file_path1 = os.path.join(current_folder_path, "文件的名字1") 
your_file_path2 = os.path.join(current_folder_path, "文件的名字2") 
 
# 我这里是以读取csv文件为例, delimiter为我们内部约定的列之间的分割符 
df1 = pd.read_csv(your_file_path1, dtype={"column1": str, "column2": str}, delimiter="/t") 
df2 = pd.read_csv(your_file_path2, dtype={"column1": str, "column2": str}, delimiter="/t")

文件的拼接及计算

文件的拼接主要就是merge和concat两个语法的使用，强调一下小知识点

merge语法主要是对应于sql语言的内连接，外连接，左连接和右连接等
concat主要是用来将相同结构的df单纯的拼接起来(也就是列表的总行数增加)

# 这里以左连接举例, 假设只有两个文件拼接 
ret_df = pd.merge(df1, df2, left_on=["column_name"], right_on=["column_name"], how="left")

初始化连接

导入三方库pymysql，初始化连接

# pymysql的接口获取链接 
def mysql_conn(host, user, password, db, port=3306, charset="utf8"): 
  # 传参版本 
  conn = pymysql.connect(host=host, user=user, password=password, database=db, port=port, charset=charset) 
  return conn

对应接口转换数据

数据插入要考虑写入一个事务，因为失败的话，要保证对数据库没有影响
构造符合对应接口的数据格式，通过查询，pymysql有两种可以执行语句的接口

execute(单条插入语句)
执行单条语句的接口

类似这种: Insert into table_name (column) values (value);
executemany(批量插入语句)

执行多条语句的接口
类似这种: Insert into table_name (column1, column2, column3) values (value1, value2, value3);

具体实现如下

# 先创建cursor负责操作conn接口 
conn = mysql_conn("your db host", "your username", "your password", "db name") 
cursor = conn.cursor() 
# 开启事务 
conn.begin() 
 
#############      构造批量数据的过程            ############# 
 
# 先构造需要的或是和数据库相匹配的列 
columns = list(df.columns) 
# 可以删除不要的列或者数据库没有的列名 
columns.remove("列名") 
# 重新构造df,用上面的columns,到这里你要保证你所有列都要准备往数据库写入了 
new_df = df[columns].copy() 
 
# 构造符合sql语句的列，因为sql语句是带有逗号分隔的,(这个对应上面的sql语句的(column1, column2, column3)) 
columns = ','.join(list(new_df.columns)) 
 
# 构造每个列对应的数据，对应于上面的((value1, value2, value3)) 
data_list = [tuple(i) for i in gdsord_df.values] # 每个元组都是一条数据，根据df行数生成多少元组数据 
 
# 计算一行有多少value值需要用字符串占位 
s_count = len(data_list[0]) * "%s," 
 
# 构造sql语句 
insert_sql = "insert into " + "数据库表名" + " (" + columns + ") values (" + s_count[:-1] + ")"

将数据写入数据库

这个简单，直接上代码

cursor.executemany(insert_sql, data_list) 
conn.commit() 
cursor.close() 
conn.close()

检查数据库是否插入成功

如果没问题的话，就可以同时进行多个文件读写，计算，最后启用多线程同时向数据库中写入数据了，非常高效!

大数据数据库文件数据库 python

林德强之原创

0 关注 0 粉丝 0 动态

关注关注

分布式文档存储数据库之MongoDB备份与恢复的实践详解

　　为什么要备份？　　备份的目的是对数据做冗余的一种方式，它能够让我们在某种情况下保证最少数据的丢失；之前我们对mongodb做副本集也是对数据做冗余，但是这种在副本集上做数据冗余仅仅是针对系统故障或服务异常等一些非人为的故障发生时，保证数据服务的可用性；

lbyd0 2020-11-17

分布式文档存储数据库之MongoDB分片集群的问题

　　1、什么是分片？比如用户要查询年龄大于30的用户，该怎么查询呢？而年龄大于30的用户的数据，可能server1上有一部分数据，server2上有部分数据，我们怎么才能够把所有满足条件的数据全部查询到呢？

sushuanglei 5评论 2020-11-12

Forrester发布全栈公有云开发平台报告，腾讯云再次入选领导者象限

今日获悉，国际领先行业咨询机构Forrester发布《2020年Q4中国全栈公有云开发平台Wave报告》显示，腾讯云再次入选公有云开发平台领导者象限。在2018年同主题报告中，腾讯云也曾入选。本次报告通过33项评估标准，针对中国市场最具代表性的12个厂商进

腾讯soso团队 2020-11-06

SAP AMDP介绍 - ABAP托管的HANA数据库过程

最近Jerry的处境可以用本世纪初，八零后刚上大学时校园内风靡的一款FPS游戏名称来形容: 《半条命》. 为了避免让汪子熙这个公众号成为神经外科前中颅底亚专业医学知识的普及号，咱们还是继续聊SAP技术吧。随着ABAP 7.40 SP05的发布，SAP AB

gaobudong 15评论 2020-11-04

docker容器与宿主机的数据交互方式总结

在生产环境中使用 Docker ，往往需要对数据进行持久化，或者需要在多个容器之间进行数据共享，这必然涉及容器的数据管理操作。docker cp :用于容器与主机之间的数据拷贝。当删除Docker容器，并通过该镜像重新启动时，之前的更改将会丢失。在Dock

yangkang 2020-11-09

详解Vue数据驱动原理

Vue区别于传统的JS库，例如JQuery，其中一个最大的特点就是不用手动去操作DOM，只需要对数据进行变更之后，视图也会随之更新。比如你想修改div#app里的内容:. 在代码层面上的最大区别就是，JQuery直接对DOM进行了操作，而Vue则对数据进行

85477104 13评论 2020-11-17

vue+echarts+datav大屏数据展示及实现中国地图省市县下钻功能

随着前端技术的飞速发展，大数据时代的来临，我们在开发项目时越来越多的客户会要求我们做一个数据展示的大屏，可以直观的展示用户想要的数据，同时炫酷的界面也会深受客户的喜欢。大屏展示其实就是一堆的图表能够让人一目了然地看到该系统下的一些基本数据信息的汇总，也会有

KANSYOUKYOU 2020-11-16

THINKPHP5分页数据对象处理过程解析

在用到THINKPHP5的分页的时候，我们可以发现获取的数据是对象，如果我们要对数据进行循环增加数据就实现不了。V5.0.9版本开始支持分页类后数据直接each遍历处理，方便修改分页后的数据，而不是只能通过模型的获取器来补充字段。

wushengyong 2020-10-28

需要知识的后深度学习时代，如何高效自动构建知识图谱

前沿的知识图谱自动构建技术有哪些？这篇文章将逐一解答这些问题。二者展示的信息量是差不多的，但右边这种看起来更加直观。而且，随着文本篇幅的增长，这种优势会体现得更加明显。其中，图的节点代表现实世界中存在的“实体”，图的边则代表实体之间的“关系”。基于知识图谱

lizhengjava 12评论 2020-11-13

人工智能技术如何落地交通出行？

在城市交通领域，有AI红绿灯控制，街道交通智能监测、智能公交车站，以及智能高速，这些领域都已经渗透了人工智能。围绕自动驾驶和车路协同也已经在全国多个地区进入商用测试阶段。那么日常还有哪些出行场景是应用到了AI技术的呢?大大降低了人工运营维护成本，人工审核降

星月情缘 11评论 2020-11-13

将云技术带入数据中心-走向数据驱动型业务的旅程

COVID-19产生的大量数据正在为企业创造新的增长机会，但拥有合适的基础设施对于有效应对这场数据风暴至关重要。Gartner最近警告说：“数据和分析领导者必须为多云和跨云部署的复杂性做好准备，以避免潜在的性能问题、计划外的成本超支和集成工作中的困难”。负

huangxiaoyun00 9评论 2020-11-13

联想持续发力智能物联，构建新基建时代下的行业新引擎

联想Tech World 2020创新科技大会于今日开幕。

zhoushuntian 15评论 2020-11-09

数据科学面试中应了解的十种机器学习概念

如您本文转载自公众号“读芯术”。如您所知，数据科学和机器学习必须提供无穷无尽的信息和知识。话虽如此，大多数公司都只测试少数核心思想。这是因为这十个概念是更复杂的思想和概念的基础。您可能想知道为什么我什至不愿意将其放入，因为它是如此的基础。换句话说，更加重视

luyong0 12评论 2020-11-08

雾计算在物联网中的应用

雾计算是指一种分散的计算结构。资源被放置在数据源和云之间的逻辑位置。雾计算的优点之一是可以在同一时间上维持多用户连接的状态。本质上，它提供了与基于云的解决方案相同的网络和服务，但是它增加了分散网络的安全性。随着物联网的发展，越来越多的设备被添加到网络中。据

Apsaravod 2020-11-05

AI格局正在从“数据”转变为“知识”

半个多世纪以前就引发了人工智能革命。我们看到的最常见的AI业务策略是围绕数据构建的。我们认为专有数据是AI公司目前很具战略意义的护城河，但在未来几年中，专有数据将不再是一种独特的资产，从而使专有数据差异化的可持续性降低。因此，我们希望重点从基于数据的AI策

PeterChangyb 2020-11-05

数据骗子无处不在，教你拆穿所谓“万金油”

数据分析师、机器学习/人工智能工程师、统计学家，这样的头衔是不是听起来很高大上?但小心别被骗了!高薪诱惑之下，不少数据骗子也隐藏在其中，这些骗子毁了遵纪守法的数据专业人士的好名声。第一点线索就是，他们无法理解分析学和统计学是两个截然不同的学科。这样的p值没

wwwjun 15评论 2020-11-02

模型数据出现偏差怎么办？一文了解机器学习中的7种数据偏差类型

机器学习中的数据偏差是一种错误，其中数据集的某些元素的权重和/或表示程度高于其他元素。偏置数据集不能准确表示模型的用例，从而导致结果偏斜、精度低和分析错误。通常，机器学习项目的培训数据必须代表现实世界。数据偏差可能发生在一系列领域，从人类报告和选择偏差到算

gyunwh 2020-11-02

机器学习中处理缺失值的9种方法

它是任何数据科学或机器学习项目的关键。在大多数情况下，当我们从不同的资源收集数据或从某处下载数据时，几乎有95%的可能性我们的数据中包含缺失的值。我们不能对包含缺失值的数据进行分析或训练机器学习模型。这就是为什么我们90%的时间都花在数据预处理上的主要原因

EchoYY 14评论 2020-10-31

人工智能和机器学习如何从物联网数据中提取关键见解

过去几年，围绕物联网的大部分讨论都集中在连网设备本身——它们是什么、有多少以及如何保护它们。虽然所有这些小端点都很重要，但在物联网中更重要的是这些设备所生成的大量数据，以及通过分析可以从中获得的业务见解。这些缺点在物联网环境中更加严重，在物联网环境中，大量

dingyahui 14评论 2020-10-30

IT打工人，AI来“抢”你饭碗了！这次从数据中心下手

ningwentao 14评论 2020-10-30

安科网

100%让你在10分钟内学会如何用Python将数据批量的插入到数据库

林德强之原创

需求原因

版本库信息

逻辑梳理

分步实现及分析

林德强之原创

相关推荐

分布式文档存储数据库之MongoDB备份与恢复的实践详解

分布式文档存储数据库之MongoDB分片集群的问题

Forrester发布全栈公有云开发平台报告，腾讯云再次入选领导者象限

SAP AMDP介绍 - ABAP托管的HANA数据库过程

docker容器与宿主机的数据交互方式总结

详解Vue数据驱动原理

vue+echarts+datav大屏数据展示及实现中国地图省市县下钻功能

THINKPHP5分页数据对象处理过程解析

需要知识的后深度学习时代，如何高效自动构建知识图谱

人工智能技术如何落地交通出行？

将云技术带入数据中心-走向数据驱动型业务的旅程

联想持续发力智能物联，构建新基建时代下的行业新引擎

数据科学面试中应了解的十种机器学习概念

雾计算在物联网中的应用

AI格局正在从“数据”转变为“知识”

数据骗子无处不在，教你拆穿所谓“万金油”

模型数据出现偏差怎么办？一文了解机器学习中的7种数据偏差类型

机器学习中处理缺失值的9种方法

人工智能和机器学习如何从物联网数据中提取关键见解

IT打工人，AI来“抢”你饭碗了！这次从数据中心下手

林德强之原创