From ae609d680e967b6bc9999415a88bbd30abb2ff9a Mon Sep 17 00:00:00 2001 From: Sourab Mangrulkar <13534540+pacman100@users.noreply.github.com> Date: Fri, 2 Dec 2022 16:21:16 +0530 Subject: [PATCH] add examples and update README --- Makefile | 2 +- README.md | 45 +- examples/pet_lora_seq2seq.ipynb | 4815 ++++++++++++++++++ examples/pet_lora_seq2seq_accelerate_fsdp.py | 137 + examples/pet_prefix_tuning_seq2seq.ipynb | 1963 +++++++ 5 files changed, 6958 insertions(+), 4 deletions(-) create mode 100644 examples/pet_lora_seq2seq.ipynb create mode 100644 examples/pet_lora_seq2seq_accelerate_fsdp.py create mode 100644 examples/pet_prefix_tuning_seq2seq.ipynb diff --git a/Makefile b/Makefile index e1c15c5..888056d 100644 --- a/Makefile +++ b/Makefile @@ -1,6 +1,6 @@ .PHONY: quality style test docs -check_dirs := src +check_dirs := src examples # Check that source code meets quality standards diff --git a/README.md b/README.md index 95eeccf..1dfafca 100644 --- a/README.md +++ b/README.md @@ -1,5 +1,5 @@ # 🤗 PET -Parameter-Efficient Tuning. Intergrated with 🤗 Accelerate to scale seamlessly to large models using PyTorch FSDP. +Parameter-Efficient Tuning methods enable . Intergrated with 🤗 Accelerate to scale seamlessly to large models using PyTorch FSDP. Supported methods: @@ -38,19 +38,56 @@ For scaling to large models, you can leverage 🤗 Accelerate's PyTorch FSDP int PyTorch FSDP shards parameters, gradients and optimizer states across data parallel workers which enables large language models to fit on available hardware. It also supports CPU offloading to further enable distributed training at scale. -The support for DeepSpeed ZeRO Stage-3 is currently in backlog. ```python from pet.utils.other import fsdp_auto_wrap_policy ... -if accelerator.state.fsdp_plugin is not None: +if os.environ.get("ACCELERATE_USE_FSDP", None) is not None: accelerator.state.fsdp_plugin.auto_wrap_policy = fsdp_auto_wrap_policy(model) model = accelerator.prepare(model) ``` +Example of parameter efficient tuning with `mt0-xxl` base model using 🤗 Accelerate is provided in `~examples/pet_lora_seq2seq_accelerate_fsdp.py`. +1. First run `accelerate config --config_file fsdp_config.yaml` and answer the questionaire. +Below are the contents of the config file. +``` +command_file: null +commands: null +compute_environment: LOCAL_MACHINE +deepspeed_config: {} +distributed_type: FSDP +downcast_bf16: 'no' +dynamo_backend: 'NO' +fsdp_config: + fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP + fsdp_backward_prefetch_policy: BACKWARD_PRE + fsdp_offload_params: true + fsdp_sharding_strategy: 1 + fsdp_state_dict_type: FULL_STATE_DICT + fsdp_transformer_layer_cls_to_wrap: T5Block +gpu_ids: null +machine_rank: 0 +main_process_ip: null +main_process_port: null +main_training_function: main +megatron_lm_config: {} +mixed_precision: 'no' +num_machines: 1 +num_processes: 2 +rdzv_backend: static +same_network: true +tpu_name: null +tpu_zone: null +use_cpu: false +``` +2. run the below command to launch example script +``` +accelerate launch --config_file fsdp_config.yaml examples/pet_lora_seq2seq_accelerate_fsdp.py +``` + ## Models support matrix @@ -85,5 +122,7 @@ model = accelerator.prepare(model) ## Caveats: 1. Doesn't work currently with DeeSpeed ZeRO Stage-3. Extending support with DeeSpeed ZeRO Stage-3 is in backlog. +2. When using `P_TUNING` or `PROMPT_TUNING` with `SEQ_2_SEQ` task, remember to remove the `num_virtual_token` virtual prompt predictions from the left side of the model outputs during evaluations. + diff --git a/examples/pet_lora_seq2seq.ipynb b/examples/pet_lora_seq2seq.ipynb new file mode 100644 index 0000000..f8d86c6 --- /dev/null +++ b/examples/pet_lora_seq2seq.ipynb @@ -0,0 +1,4815 @@ +{ + "cells": [ + { + "cell_type": "code", + "execution_count": 17, + "id": "5f93b7d1", + "metadata": {}, + "outputs": [], + "source": [ + "from transformers import AutoModelForSeq2SeqLM\n", + "from pet import get_pet_config,get_pet_model, get_pet_model_state_dict\n", + "import torch\n", + "from datasets import load_dataset\n", + "import os\n", + "os.environ[\"TOKENIZERS_PARALLELISM\"] = \"false\"\n", + "from transformers import AutoTokenizer\n", + "from torch.utils.data import DataLoader\n", + "from transformers import default_data_collator,get_linear_schedule_with_warmup\n", + "from tqdm import tqdm\n", + "from datasets import load_dataset\n", + "\n", + "device = \"cuda\"\n", + "model_name_or_path = \"bigscience/mt0-large\"\n", + "tokenizer_name_or_path = \"bigscience/mt0-large\"\n", + "\n", + "config = {\n", + " \"pet_type\":\"LORA\",\n", + " \"task_type\":\"SEQ_2_SEQ_LM\",\n", + " \"r\":16,\n", + " \"lora_alpha\": 32,\n", + " \"lora_dropout\": 0.1\n", + "}\n", + "checkpoint_name = \"financial_sentiment_analysis_lora_v1.pt\"\n", + "text_column = \"sentence\"\n", + "label_column = \"text_label\"\n", + "max_length=128\n", + "lr = 1e-3\n", + "num_epochs = 3\n", + "batch_size=8\n" + ] + }, + { + "cell_type": "code", + "execution_count": 2, + "id": "8d0850ac", + "metadata": {}, + "outputs": [ + { + "name": "stdout", + "output_type": "stream", + "text": [ + "trainable params: 4718592 || all params: 1234299904 || trainable%: 0.38228893842642636\n" + ] + }, + { + "data": { + "text/plain": [ + "PETModelForSeq2SeqLM(\n", + " (base_model): LoRAModel(\n", + " (model): MT5ForConditionalGeneration(\n", + " (shared): Embedding(250112, 1024)\n", + " (encoder): T5Stack(\n", + " (embed_tokens): Embedding(250112, 1024)\n", + " (block): ModuleList(\n", + " (0): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (relative_attention_bias): Embedding(32, 16)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (1): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (2): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (3): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (4): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (5): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (6): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (7): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (8): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (9): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (10): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (11): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (12): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (13): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (14): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (15): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (16): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (17): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (18): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (19): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (20): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (21): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (22): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (23): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " )\n", + " (final_layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (decoder): T5Stack(\n", + " (embed_tokens): Embedding(250112, 1024)\n", + " (block): ModuleList(\n", + " (0): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (relative_attention_bias): Embedding(32, 16)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (1): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (2): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (3): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (4): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (5): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (6): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (7): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (8): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (9): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (10): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (11): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (12): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (13): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (14): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (15): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (16): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (17): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (18): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (19): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (20): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (21): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (22): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " (23): T5Block(\n", + " (layer): ModuleList(\n", + " (0): T5LayerSelfAttention(\n", + " (SelfAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (1): T5LayerCrossAttention(\n", + " (EncDecAttention): T5Attention(\n", + " (q): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (k): Linear(in_features=1024, out_features=1024, bias=False)\n", + " (v): Linear(\n", + " in_features=1024, out_features=1024, bias=False\n", + " (lora_dropout): Dropout(p=0.1, inplace=False)\n", + " (lora_A): Linear(in_features=1024, out_features=16, bias=False)\n", + " (lora_B): Linear(in_features=16, out_features=1024, bias=False)\n", + " )\n", + " (o): Linear(in_features=1024, out_features=1024, bias=False)\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (2): T5LayerFF(\n", + " (DenseReluDense): T5DenseGatedActDense(\n", + " (wi_0): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wi_1): Linear(in_features=1024, out_features=2816, bias=False)\n", + " (wo): Linear(in_features=2816, out_features=1024, bias=False)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " (act): NewGELUActivation()\n", + " )\n", + " (layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " )\n", + " )\n", + " )\n", + " (final_layer_norm): FusedRMSNorm(torch.Size([1024]), eps=1e-06, elementwise_affine=True)\n", + " (dropout): Dropout(p=0.1, inplace=False)\n", + " )\n", + " (lm_head): Linear(in_features=1024, out_features=250112, bias=False)\n", + " )\n", + " )\n", + ")" + ] + }, + "execution_count": 2, + "metadata": {}, + "output_type": "execute_result" + } + ], + "source": [ + "# creating model\n", + "pet_config = get_pet_config(config)\n", + "\n", + "model = AutoModelForSeq2SeqLM.from_pretrained(model_name_or_path)\n", + "model = get_pet_model(model, pet_config)\n", + "model.print_trainable_parameters()\n", + "model" + ] + }, + { + "cell_type": "code", + "execution_count": 3, + "id": "4ee2babf", + "metadata": {}, + "outputs": [ + { + "name": "stderr", + "output_type": "stream", + "text": [ + "/home/sourab/miniconda3/envs/ml/lib/python3.10/site-packages/huggingface_hub/utils/_deprecation.py:97: FutureWarning: Deprecated argument(s) used in 'dataset_info': token. Will not be supported from version '0.12'.\n", + " warnings.warn(message, FutureWarning)\n", + "Found cached dataset financial_phrasebank (/home/sourab/.cache/huggingface/datasets/financial_phrasebank/sentences_allagree/1.0.0/550bde12e6c30e2674da973a55f57edde5181d53f5a5a34c1531c53f93b7e141)\n" + ] + }, + { + "data": { + "application/vnd.jupyter.widget-view+json": { + "model_id": "6de075f8208349108291ac5ab7f5c980", + "version_major": 2, + "version_minor": 0 + }, + "text/plain": [ + " 0%| | 0/1 [00:00