Fix for Python 3 in conll dataset loading

This commit is contained in:
vilmar-hillow
2017-09-07 15:19:48 +03:00
parent c4d1a61746
commit 14f3f3659b
+2 -2
View File
@@ -16,7 +16,7 @@ def load_data(path='conll2000.zip', min_freq=2):
archive.close()
word_counts = Counter(row[0].lower() for sample in train for row in sample)
vocab = ['<pad>', '<unk>'] + [w for w, f in word_counts.iteritems() if f >= min_freq]
vocab = ['<pad>', '<unk>'] + [w for w, f in iter(word_counts.items()) if f >= min_freq]
pos_tags = sorted(list(set(row[1] for sample in train + test for row in sample))) # in alphabetic order
chunk_tags = sorted(list(set(row[2] for sample in train + test for row in sample))) # in alphabetic order
@@ -27,7 +27,7 @@ def load_data(path='conll2000.zip', min_freq=2):
def _parse_data(fh):
string = fh.read()
data = [[row.split() for row in sample.split('\n')] for sample in string.strip().split('\n\n')]
data = [[row.split() for row in sample.split('\n')] for sample in string.decode().strip().split('\n\n')]
fh.close()
return data