mirror of
https://github.com/wassname/Open-Assistant.git
synced 2026-07-29 11:15:42 +08:00
[feature] add initial version of anthropic dataset
This commit is contained in:
@@ -99,8 +99,8 @@ def argument_parsing(parser):
|
||||
return params
|
||||
|
||||
|
||||
def get_datasets(dataset_list: List[AnyStr]):
|
||||
from rank_datasets import GPTJSynthetic, HFSummary, WebGPT
|
||||
def get_datasets(dataset_list: List[AnyStr], tokenizer):
|
||||
from rank_datasets import AnthropicRLHF, GPTJSynthetic, HFSummary, WebGPT
|
||||
from torch.utils.data import ConcatDataset
|
||||
|
||||
train_datasets, evals = [], {}
|
||||
@@ -121,6 +121,11 @@ def get_datasets(dataset_list: List[AnyStr]):
|
||||
train, eval = train_val_dataset(dataset, 0.1)
|
||||
train_datasets.append(train)
|
||||
evals["gptsynthetic"] = eval
|
||||
elif "anthropic_rlhf" == dataset_name:
|
||||
train = AnthropicRLHF("train", tokenizer.sep_token)
|
||||
eval = AnthropicRLHF("test", tokenizer.sep_token)
|
||||
train_datasets.append(train)
|
||||
evals["anthropic_rlhf"] = eval
|
||||
train = ConcatDataset(train_datasets)
|
||||
return train, evals
|
||||
|
||||
|
||||
Reference in New Issue
Block a user