Python读取目录中的文件并进行连接

Question

我想编写一个Python脚本，该脚本搜索当前目录中的所有文件夹，查找所有.txt文件，并创建一个文件，该文件是当前目录中所有这些文件（以任何顺序）的串联。 如果文件夹包含子文件夹，则不应搜索这些子文件夹。 一个例子是

main_folder
  folder_1
    sub_folder
      file1.txt
    file2.txt
  folder_2
    file3.txt

该脚本位于main_folder 。 它应该创建一个文件，该文件是file2.txt内部的file2.txt和file3.txt （以任何顺序）的main_folder 。

我的问题是：如何告诉Python遍历文件夹，查找.txt文件，而无需进入子文件夹？

Answer 1

使用glob ：

>>> import glob
>>> glob.glob('main_folder/*/*.txt')
['main_folder/folder_1/file2.txt', 'main_folder/folder_2/file3.txt']

Answer 2

从文档：

当自上而下为True ，主叫方可以就地（可能使用修改dirnames中列表del或切片分配），和walk()将只迭代到他们的名字留在dirnames中的子目录; 这可用于修剪搜索，强加特定的访问顺序，甚至可在调用者再次恢复walk()之前向walk()告知调用者创建或重命名的目录。

Answer 3

使用topdown选项设置为True的os.walk（）函数。 删除返回的元组中的所有dirnames ：

for root, dirs, files in os.walk('/base/dir', topdown=True):
    del dirs[:]
...

Answer 4

如果您使用的是基于Unix的系统，那么我认为最简单的方法是使用python subprocess模块来使用find和cat 。 使用find -depth选项确实有帮助，例如，使用-depth +3查找深度> = 3的所有文件。

>>> import subprocess
>>> lst = subprocess.check_output('find . -name "*.txt" -depth 2', shell=True)
>>> print lst
./folder_1/f1.txt
./folder_2/f2.txt 
>>> out_f = subprocess.check_output('cat '+lst.replace('\n', ' '), shell=True)
>>> print out_f
inside Folder_1
inside Folder 2

您可以通过分别提供每个参数来避免shell=True 。

Python读取目录中的文件并进行连接

问题描述

4 个解决方案

解决方案1
3 已采纳 2012-11-05 05:04:59

解决方案2
1 2012-11-05 04:58:16

解决方案3
1 2012-11-05 05:06:25

解决方案4
0 2012-11-05 05:24:51

Python读取目录中的文件并进行连接

问题描述

4 个解决方案

解决方案1 3 已采纳 2012-11-05 05:04:59

解决方案2 1 2012-11-05 04:58:16

解决方案3 1 2012-11-05 05:06:25

解决方案4 0 2012-11-05 05:24:51

解决方案1
3 已采纳 2012-11-05 05:04:59

解决方案2
1 2012-11-05 04:58:16

解决方案3
1 2012-11-05 05:06:25

解决方案4
0 2012-11-05 05:24:51