保存一个文本字符串，如果它由另一个特定的文本字符串进行？

filename = 'C0_GGCTAC_R1_no_adapter_trimming.fastq' new_filename = filename[:-9] + '_new.fastq' with open(filename) as f_obj: file_contents = f_obj.readlines() extracted_lines = '' line_count = 0 # Pull header and base lines for line in file_contents: line_count += 1 # Headers if line_count == 1: extracted_lines += line # Reads ending in A elif line_count == 2 and line[-2] == 'A': extracted_lines += line # Reads ending in G elif line_count == 2 and line[-2] == 'G': extracted_lines += line # Reset counter elif line_count == 4: line_count = 0 with open(new_filename, 'w') as f_obj: f_obj.write(extracted_lines) print(new_filename + " was created.")

@HWI-D00461:137:C9H2FACXX:3:1101:1239:1968 1:N:0:GGCTAC NTGTGTAATAGATTTTACTTTTGCCTTTAAGCCCAAGGTCCTGGACTTGAAACATCCAAGGGATGGAAAATGCCGTATAACAGGGTGGAAGAGAGATTTGA + #1=BDDFFHHHFHIJJJJJJJJJJJJJJJJJJJJJIJJIJJJJJHJIIJHGIJJJJJJIHJJBGHJHIIJJJHHHHFFFFEEEDD;?BACDDDA?@CDDDC @HWI-D00461:137:C9H2FACXX:3:1101:1117:1968 1:N:0:GGCTAC NAAAGTCTACCAATTATACTTAGTGTGAAGAGGTGGGAGTTAAATATGACTTCCATTAATAGTTTCATTGTTTGGAAAACAGAGGTAATTTTTGATACAGA + #1=DDDFDFHHHGHIIGJJJJHIJIHHDIHHIJGGEI@GFGHIHIJHEFHIIIIGIJGHHGECFGIDHGIHIIEGIIJHHEEFFF7?ACEECCBBDEDDDC

@HWI-D00461:137:C9H2FACXX:3:1101:1117:1968 1:N:0:GGCTAC NAAAGTCTACCAATTATACTTAGTGTGAAGAGGTGGGAGTTAAATATGACTTCCATTAATAGTTTCATTGTTTGGAAAACAGAGGTAATTTTTGATACAGA @HWI-D00461:137:C9H2FACXX:3:1101:1200:1972 1:N:0:GGCTAC @HWI-D00461:137:C9H2FACXX:3:1101:1087:1973 1:N:0:GGCTAC NTAATCCAACTAACTAAAAATAAAAAGATTCAAATAGGTACAGAAAACAATGAAGGTGTAGAGGTGAGAAATCAACAGGATGTTCAGAAGCCTGTGTATGA

2条回答

网友

1楼 · 编辑于 2024-09-30 18:13:04

问题是，您将id添加到每个记录，而不仅仅是您感兴趣的记录。一个快速的解决方案是将id保持在一个变量中，并且只在必要时添加它：

filename = 'C0_GGCTAC_R1_no_adapter_trimming.fastq'
new_filename = filename[:-9] + '_new.fastq'

with open(filename) as f_obj:
    file_contents = f_obj.readlines()

extracted_lines = ''
line_count = 0

# Pull header and base lines
for line in file_contents:
    line_count += 1
    # Headers
    if line_count == 1:
        id_string = line
    # Reads ending in A
    elif line_count == 2 and line[-2] == 'A':
        extracted_lines += id_string
        extracted_lines += line
    # Reads ending in G
    elif line_count == 2 and line[-2] == 'G':
        extracted_lines += id_string
        extracted_lines += line
    # Reset counter
    elif line_count == 4:
        line_count = 0

with open(new_filename, 'w') as f_obj:
    f_obj.write(extracted_lines)
print(new_filename + " was created.")

我还不得不说，代码的效率不高，特别是在内存使用方面：您正在将一个（通常）非常大的文件读入内存，但一次只需要一条记录

第二个问题是可以压缩条件，并且可以使用模来了解所处的线型：

filename = 'C0_GGCTAC_R1_no_adapter_trimming.fastq'
new_filename = filename[:-9] + '_new.fastq'

with open(filename) as in_f_obj, open(new_filename, 'w') as out_f_obj:
    # Process the file
    line_count = 0
    for line in in_f_obj:
        line_count += 1

        # Extract the information for each record
        if line_count % 4 == 1:
            id_string = line
        elif line_count % 4 == 2:
            seq = line
        elif line_count % 4 == 3:
            extra = line
        elif line_count % 4 == 4:
            # Last part of the record. Here we have all the information
            # and we can decide if we want to output something
            # and what we want to output
            qual = line
            if seq[-2] == 'A' or seq[-2] == 'G'
                out_f_obj.write(id_string)
                out_f_obj.write(seq)

print(new_filename + " was created.")

在这段代码中，您只在内存中保留一条记录。line_count变量包含实际处理的行数，并且您拥有来自输入的所有数据，因此您可以很容易地在以后更改输出

我会添加一个额外的细节，我会在每一行中去掉换行符，并在写作时添加它（如果需要）：

# Extract the information for each record
if line_count % 4 == 1:
    id_string = line.rstrip()
elif line_count % 4 == 2:
    seq = line.rstrip()
elif line_count % 4 == 3:
    extra = line.rstrip()
elif line_count % 4 == 4:
    # Last part of the record. Here we have all the information
    # and we can decide if we want to output something
    # and what we want to output
    qual = line.rstrip()
    if seq[-1] == 'A' or seq[-1] == 'G'
        out_f_obj.write("{}\n{}\n".format(id_string, seq))

这样，您的数据是干净的，输入文件中没有新行格式

网友

2楼 · 编辑于 2024-09-30 18:13:04

我认为用4行步骤而不是单行来遍历文件会使您的任务更容易。至少假设真的总是有4条线是彼此的。然后，可以在附加相应的标题行之前过滤所需的基，例如：

extracted_lines = []
for i in range(0, len(file_contents), 4):
    header, bases, comment1, comment2 = file_contents[i:i+4]
    if bases[-1] in ["A", "G"]:
        extracted_lines.append(header)
        extracted_lines.append(bases)

相关问题更多 >

编程相关推荐

热门问题

热门文章