[英]How can I randomize the lines in a file using standard tools on Red Hat Linux?
如何使用Red Hat Linux上的标准工具随机化文件中的行?
我没有shuf
命令,所以我正在寻找像perl
或awk
one-liner这样的东西来完成同样的任务。
嗯,别忘了
sort --random-sort
shuf
是最好的方式。
sort -R
非常缓慢。 我只是尝试排序5GB文件。 我放弃了2.5小时后。 然后shuf
在一分钟内对它进行了分类。
你得到一个Perl单线程!
perl -MList::Util -e 'print List::Util::shuffle <>'
它使用模块,但该模块是Perl代码分发的一部分。 如果这还不够好,你可以考虑自己动手。
我尝试使用-i
标志(“编辑就地”)来编辑文件。 文档表明它应该有效,但事实并非如此。 它仍然将混洗文件显示到stdout,但这次它会删除原始文件。 我建议你不要用它。
考虑一个shell脚本:
#!/bin/sh
if [[ $# -eq 0 ]]
then
echo "Usage: $0 [file ...]"
exit 1
fi
for i in "$@"
do
perl -MList::Util -e 'print List::Util::shuffle <>' $i > $i.new
if [[ `wc -c $i` -eq `wc -c $i.new` ]]
then
mv $i.new $i
else
echo "Error for file $i!"
fi
done
未经测试,但希望有效。
cat yourfile.txt | while IFS= read -r f; do printf "%05d %s\n" "$RANDOM" "$f"; done | sort -n | cut -c7-
读取文件,在每行前面加一个随机数,在这些随机前缀上对文件进行排序,然后剪切前缀。 单衬里应该适用于任何半现代的外壳。
编辑:纳入理查德汉森的言论。
python的单线程:
python -c "import random, sys; lines = open(sys.argv[1]).readlines(); random.shuffle(lines); print ''.join(lines)," myFile
并且只打印一条随机线:
python -c "import random, sys; print random.choice(open(sys.argv[1]).readlines())," myFile
但是请看这篇文章 ,了解python的random.shuffle()
的缺点。 它不适用于许多(超过2080个)元素。
与Jim的回答有关:
我的~/.bashrc
包含以下内容:
unsort ()
{
LC_ALL=C sort -R "$@"
}
使用GNU coreutils的排序, -R
= --random-sort
,它生成每行的随机散列并按其排序。 随机散列实际上不会在某些较旧(错误)版本的某些语言环境中使用,导致它返回正常的排序输出,这就是我设置LC_ALL=C
。
与Chris的回答有关:
perl -MList::Util=shuffle -e'print shuffle<>'
是一个稍短的单线。 ( -Mmodule=a,b,c
是-e 'use module qw(abc);'
缩写。)
给它一个简单的-i
的原因不适用于就地改组是因为Perl期望print
发生在正在读取文件的同一循环中,并且print shuffle <>
直到所有输入文件都具有之后才输出已阅读并关闭。
作为一个较短的解决方法,
perl -MList::Util=shuffle -i -ne'BEGIN{undef$/}print shuffle split/^/m'
将就地文件洗牌。 ( -n
表示“将代码包装在while (<>) {...}
循环中; BEGIN{undef$/}
使Perl一次对文件进行操作,而不是一次一行地进行操作,并且split/^/m
,因为$_=<>
已隐式使用整个文件而不是行。)
当我用自制软件安装coreutils时
brew install coreutils
shuf
成为n
。
带有DarwinPorts的Mac OS X:
sudo port install unsort
cat $file | unsort | ...
FreeBSD有自己的随机工具:
cat $file | random | ...
它在/ usr / games / random中,所以如果你还没有安装游戏,那你就不走运了。
您可以考虑安装textproc / rand或textproc / msort等端口。 如果可移植性是一个问题,这些可能在Linux和/或Mac OS X上可用。
在OSX上,从http://ftp.gnu.org/gnu/coreutils/获取最新信息
./configure make sudo make install
...应该给你/ usr / local / bin / sort --random-sort
没有弄乱/ usr / bin / sort
或者从MacPorts获取:
$ sudo port install coreutils
和/或
$ /opt/local//libexec/gnubin/sort --random-sort
声明:本站的技术帖子网页,遵循CC BY-SA 4.0协议,如果您需要转载,请注明本站网址或者原文地址。任何问题请咨询:yoyou2525@163.com.