diff --git a/src/ws/data.py b/src/ws/data.py index 9daac6f..a9d7c90 100644 --- a/src/ws/data.py +++ b/src/ws/data.py @@ -544,7 +544,7 @@ def generate_pairs(cfg: DataCfg) -> Path: if tok.pad_token is None: tok.pad_token = tok.eos_token model = AutoModelForCausalLM.from_pretrained( - cfg.model_id, torch_dtype=torch.bfloat16, device_map="cuda", attn_implementation="flash_attention_2" + cfg.model_id, torch_dtype=torch.bfloat16, device_map="cuda" ) model.eval() diff --git a/src/ws/eval/tinymfv_airisk.py b/src/ws/eval/tinymfv_airisk.py index 0703aa7..57539bb 100644 --- a/src/ws/eval/tinymfv_airisk.py +++ b/src/ws/eval/tinymfv_airisk.py @@ -62,7 +62,7 @@ FRAMES: dict[str, dict[str, str | float]] = { @dataclass class TinyMFVAiriskCfg: - model: str = "Qwen/Qwen3-4B" + model: str = "Qwen/Qwen3.5-4B" behavior: str = "authority" adapter: str = "delora" out: Path = Path("out") @@ -520,7 +520,7 @@ def run_eval(cfg: TinyMFVAiriskCfg) -> tuple[pl.DataFrame, pl.DataFrame, pl.Data if tok.pad_token is None: tok.pad_token = tok.eos_token tok.padding_side = "left" - model = AutoModelForCausalLM.from_pretrained(cfg.model, torch_dtype=torch.bfloat16, device_map="cuda", attn_implementation="flash_attention_2") + model = AutoModelForCausalLM.from_pretrained(cfg.model, torch_dtype=torch.bfloat16, device_map="cuda") model.eval() vignettes = _load_vignettes(cfg.limit) diff --git a/src/ws/kl_calibrate.py b/src/ws/kl_calibrate.py index aa38952..a7f08a7 100644 --- a/src/ws/kl_calibrate.py +++ b/src/ws/kl_calibrate.py @@ -323,7 +323,7 @@ def main(cfg: KLCalibrateCfg) -> None: tok.pad_token = tok.eos_token tok.padding_side = "left" model = AutoModelForCausalLM.from_pretrained( - cfg.model, torch_dtype=torch.bfloat16, device_map="cuda", attn_implementation="flash_attention_2" + cfg.model, torch_dtype=torch.bfloat16, device_map="cuda" ) model.eval() diff --git a/src/ws/scripts/eval_tinymfv_calibrated.py b/src/ws/scripts/eval_tinymfv_calibrated.py index 810d0fd..25a2c0b 100644 --- a/src/ws/scripts/eval_tinymfv_calibrated.py +++ b/src/ws/scripts/eval_tinymfv_calibrated.py @@ -29,7 +29,7 @@ class EvalTinymfvCalibratedCfg: behavior: str = "authority" out: Path = Path("out") adapters: tuple[str, ...] = ("lora", "dora", "pissa", "delora", "oft", "ia3") - model: str = "Qwen/Qwen3-4B" + model: str = "Qwen/Qwen3.5-4B" bootstrap_samples: int = 256 limit: int = 0 batch_size: int = 16 diff --git a/src/ws/scripts/readme_tinymfv_table.py b/src/ws/scripts/readme_tinymfv_table.py index 2924f35..2addf6f 100644 --- a/src/ws/scripts/readme_tinymfv_table.py +++ b/src/ws/scripts/readme_tinymfv_table.py @@ -103,7 +103,7 @@ def _foundation_short(behavior: str) -> dict[str, str]: @dataclass class ReadmeTinymfvCfg: behavior: str = "auth_care" - model_label: str = "Qwen3-4B" + model_label: str = "Qwen3.5-4B" out: Path = Path("out") adapters: tuple[str, ...] = ("lora", "dora", "pissa", "delora", "oft", "ia3") include_prompt_baseline: bool = True diff --git a/src/ws/train.py b/src/ws/train.py index 13a4d18..f6d6a70 100644 --- a/src/ws/train.py +++ b/src/ws/train.py @@ -156,7 +156,7 @@ def train_adapter(cfg: TrainCfg, ds: Dataset) -> Path: tok.pad_token = tok.eos_token model = AutoModelForCausalLM.from_pretrained( - cfg.model_id, torch_dtype=torch.bfloat16, device_map="cuda", attn_implementation="flash_attention_2" + cfg.model_id, torch_dtype=torch.bfloat16, device_map="cuda" ) model.config.use_cache = False