[英]Python read files in directory and concatenate
我想编写一个Python脚本,该脚本搜索当前目录中的所有文件夹,查找所有.txt
文件,并创建一个文件,该文件是当前目录中所有这些文件(以任何顺序)的串联。 如果文件夹包含子文件夹,则不应搜索这些子文件夹。 一个例子是
main_folder
folder_1
sub_folder
file1.txt
file2.txt
folder_2
file3.txt
该脚本位于main_folder
。 它应该创建一个文件,该文件是file2.txt
内部的file2.txt
和file3.txt
(以任何顺序)的main_folder
。
我的问题是:如何告诉Python遍历文件夹,查找.txt
文件,而无需进入子文件夹?
使用glob :
>>> import glob
>>> glob.glob('main_folder/*/*.txt')
['main_folder/folder_1/file2.txt', 'main_folder/folder_2/file3.txt']
从文档 :
当自上而下为
True
,主叫方可以就地(可能使用修改dirnames中列表del
或切片分配),和walk()
将只迭代到他们的名字留在dirnames中的子目录; 这可用于修剪搜索,强加特定的访问顺序,甚至可在调用者再次恢复walk()
之前向walk()
告知调用者创建或重命名的目录。
使用topdown
选项设置为True的os.walk()函数。 删除返回的元组中的所有dirnames
:
for root, dirs, files in os.walk('/base/dir', topdown=True):
del dirs[:]
...
如果您使用的是基于Unix的系统,那么我认为最简单的方法是使用python subprocess
模块来使用find
和cat
。 使用find
-depth
选项确实有帮助,例如,使用-depth +3
查找深度> = 3的所有文件。
>>> import subprocess
>>> lst = subprocess.check_output('find . -name "*.txt" -depth 2', shell=True)
>>> print lst
./folder_1/f1.txt
./folder_2/f2.txt
>>> out_f = subprocess.check_output('cat '+lst.replace('\n', ' '), shell=True)
>>> print out_f
inside Folder_1
inside Folder 2
您可以通过分别提供每个参数来避免shell=True
。
声明:本站的技术帖子网页,遵循CC BY-SA 4.0协议,如果您需要转载,请注明本站网址或者原文地址。任何问题请咨询:yoyou2525@163.com.