python 读取多个csv文件中某一列,并生成一个新csv文件

发布网友发布时间：2022-04-23 17:39

我来回答

共3个回答

懂视网时间：2022-05-10 20:27

本文主要为大家分享一篇Python读csv文件去掉一列后再写入新的文件实例，具有很的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧，希望能帮助到大家更好掌握Python

用了两种.方式解决该问题，都是网上现有的解决方案。

场景说明：

有一个数据文件，以文本方式保存，现在有三列user_id,plan_id,mobile_id。目标是得到新文件只有mobile_id,plan_id。

解决方案

方案一：用python的打开文件写文件的方式直接撸一遍数据，for循环内处理数据并写入到新文件。

代码如下：

def readwrite1( input_file,output_file):
 f = open(input_file, 'r')
 out = open(output_file,'w')
 print (f)
 for line in f.readlines():
 a = line.split(",")
 x=a[0] + "," + a[1]+"
"
 out.writelines(x)
 f.close()
 out.close()

方案二：用 pandas 读数据到 DataFrame 再做数据分割，直接用 DataFrame 的写入功能写到新文件

代码如下：

def readwrite2(input_file,output_file): date_1=pd.read_csv(input_file,header=0,sep=',') date_1[['mobile', 'plan_id']].to_csv(output_file, sep=',', header=True,index=False)

从代码上看，pandas逻辑更清晰。

下面看下执行的效率吧！

def getRunTimes( fun ,input_file,output_file):
 begin_time=int(round(time.time() * 1000))
 fun(input_file,output_file)
 end_time=int(round(time.time() * 1000))
 print("读写运行时间：",(end_time-begin_time),"ms")

getRunTimes(readwrite1,input_file,output_file) #直接撸数据
getRunTimes(readwrite2,input_file,output_file1) #使用dataframe读写数据

读写运行时间： 976 ms

读写运行时间： 777 ms

input_file 大概有27万的数据，dataframe的效率比for循环效率还是要快一点的，如果数据量更大些，效果是否更明显呢？

下面试下增加input_file记录的数量试试，有如下结果

input_file	readwrite1	readwrite2
27W	976	777
55W	1989	1509
110W	4312	3158

从上面测试结果来看,dataframe的效率提高大约30%左右。

热心网友时间：2022-05-10 17:35

csv文件应该是用逗号分隔得才对，否则怎么算作是csv文件。楼主你开玩笑吧。否则你这只是一个普通的文本文件。如果是真正的csv文件，我只说一点，python里面有csv模块，专门处理csv文件。如果是空格分割应该也可以，建议你，看一下python的csv模块的API，蛮简单的代码，其实如果不用的话自己写也可以。不是很复杂。代码片段如下：

def deal_file(file_in, file_out)
    with open(file_in, 'r') as f_in:
        with open(file_out, 'w') as f_out:
            for line in f_in:
                f_out.write(line.split(' ')[2] + '\n')
之后你可以将所有的输入文件放到一个列表里面，进行迭代调用这个函数就可以了。

热心网友时间：2022-05-10 18:53

参考方法如下：
逐行处理：
for line in open("samples/sample.csv"):
title, year, director = line.split(",") //以“,”号为分割，按逗号将数据分成三部分；
print year, title
使用csv模块处理：
import csv
reader = csv.reader(open("samples\sample.csv"))
for title, year, director in reader:
print year, title
改变分隔符；