我有一个具有以下结构的文本文件
ID,operator,a,b,c,d,true
WCBP12236,J1,75.7,80.6,65.9,83.2,82.1
WCBP12236,J2,76.3,79.6,61.7,81.9,82.1
WCBP12236,S1,77.2,81.5,69.4,84.1,82.1
WCBP12236,S2,68.0,68.0,53.2,68.5,82.1
WCBP12234,J1,63.7,67.7,72.2,71.6,75.3
WCBP12234,J2,68.6,68.4,41.4,68.9,75.3
WCBP12234,S1,81.8,82.7,67.0,87.5,75.3
WCBP12234,S2,66.6,67.9,53.0,70.7,75.3
WCBP12238,J1,78.6,79.0,56.2,82.1,84.1
WCBP12239,J2,66.6,72.9,79.5,76.6,82.1
WCBP12239,S1,86.6,87.8,23.0,23.0,82.1
WCBP12239,S2,86.0,86.9,62.3,89.7,82.1
WCBP12239,J1,70.9,71.3,66.0,73.7,82.1
WCBP12238,J2,75.1,75.2,54.3,76.4,84.1
WCBP12238,S1,65.9,66.0,40.2,66.5,84.1
WCBP12238,S2,72.7,73.2,52.6,73.9,84.1
每个ID
对应一个数据集,该数据集由一个运算符分析多次。i、 eJ1
和J2
是运算符J的第一次和第二次尝试。度量a
、b
、c
和{true
列中
我想做的是创建3个新的文本文件,比较J1
vsJ2
,S1
vsS2
和{S1
的结果。J1
vsJ2
的示例输出:
其中a1
是J1
等的测量a
另一个例子是S1
vsS2
:
ID,operator,a1,a2,b1,b2,c1,c2,d1,d2,true
WCBP12236,77.2,68.0,81.5,68.0,69.4,53.2,84.1,68.5,82.1
WCBP12234,81.8,66.6,82.7,67.9,67.0,53,87.5,70.7,75.3
ID将不会按字母数字顺序排列,也不会为同一个ID聚集运算符。我不确定如何最好地处理此任务—使用linux工具或perl/python之类的脚本语言。在
我最初使用linux的尝试很快就遇到了困难
首先查找所有唯一ID(排序)
awk -F, '/^WCBP/ {print $1}' file | uniq | sort -k 1.5n > unique_ids
循环这些ID并排序J1
,J2
:
foreach i (`more unique_ids`)
grep $i test.txt | egrep 'J[1-2]' | sort -t',' -k2
end
给我分类的数据
WCBP12234,J1,63.7,67.7,72.2,71.6,75.3
WCBP12234,J2,68.6,68.4,41.4,68.9,80.4
WCBP12236,J1,75.7,80.6,65.9,83.2,82.1
WCBP12236,J2,76.3,79.6,61.7,81.9,82.1
WCBP12238,J1,78.6,79.0,56.2,82.1,82.1
WCBP12238,J2,75.1,75.2,54.3,76.4,82.1
WCBP12239,J1,70.9,71.3,66.0,73.7,75.3
WCBP12239,J2,66.6,72.9,79.5,76.6,75.3
我不知道如何重新排列这些数据以获得所需的结构。我尝试在foreach
循环awk 'BEGIN {RS="\n\n"} {print $1, $3,$10,$4,$11,$5,$12,$6,$13,$7}'
中的awk
添加一个额外的管道
有什么想法吗?我确信使用awk
可以以一种不那么麻烦的方式完成,尽管使用适当的脚本语言可能会更好。在
我没有像TLP那样使用Text::CSV。如果你需要的话,你可以,但是在这个例子中,我想因为字段中没有嵌入逗号,所以我对','做了一个简单的拆分。另外,两个运算符的真字段都列出来了(而不是1),因为我认为最后一个值的特殊情况会使解决方案复杂化。在
产生的输出文件如下
J1 J2.txt
^{pr2}$S1 S2.txt
J1 S1.txt
更新:为了只得到1个真值,for循环可以这样写:
更新:为grep expr中的测试添加了“defined”。因为这是正确的方法(而不是仅仅测试'$\',它可能是0并且被grep错误地排除在列表之外)。在
Python方式:
开/关:
您可以使用Perl csv模块Text::CSV提取字段,然后将它们存储在散列中,其中ID是主键,第二个字段是次关键字,所有字段都作为值存储。这样做任何你想做的比较都应该是微不足道的。如果要保留行的原始顺序,可以在第一个循环中使用数组。在
相关问题 更多 >
编程相关推荐