Training in progress, step 100, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +203 -4

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:53518718170f27ca1a52e2632045bddc635ff72631f0cc6909995db0de68ce69
 size 167832240

 version https://git-lfs.github.com/spec/v1
+oid sha256:05140f4625d84099df0fa660221bae343c07e7d51987cccc53237d110b133659
 size 167832240

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:a6ff70b1d9ad29b3f17057251724ecddded918d49e6ccd4a3e0475da6d86372c
 size 335922386

 version https://git-lfs.github.com/spec/v1
+oid sha256:f3515f1c6594647d478de266d8281726d4c043941357bf69eda260b6b8d20ad7
 size 335922386

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:ecbf52846b0950d1b0204ef5064ad518cb02596007e36540f5b060f1237792f0
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:d84f8729dd1de7f4282fffad9f7e569effad263825b832a900fab5a7e2e20f99
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f23e2214bcafb439ebc7528dcc283ef6218d509a276c0baff0743503ecbe3d92
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:49d60a69e2379be2053e816cbaff31e6c931b5922dd86c71c9eaf473299cbf62
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 0.3712871287128713,
   "eval_steps": 9,
-  "global_step": 75,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -604,6 +604,205 @@
       "learning_rate": 1.7860619515673033e-05,
       "loss": 0.9297,
       "step": 75
     }
   ],
   "logging_steps": 1,
@@ -618,12 +817,12 @@
         "should_evaluate": false,
         "should_log": false,
         "should_save": true,
-        "should_training_stop": false
       },
       "attributes": {}
     }
   },
-  "total_flos": 5.56415462670336e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null

 {
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 0.49504950495049505,
   "eval_steps": 9,
+  "global_step": 100,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "learning_rate": 1.7860619515673033e-05,
       "loss": 0.9297,
       "step": 75
+    },
+    {
+      "epoch": 0.37623762376237624,
+      "grad_norm": 0.6353140473365784,
+      "learning_rate": 1.6543469682057106e-05,
+      "loss": 1.1964,
+      "step": 76
+    },
+    {
+      "epoch": 0.3811881188118812,
+      "grad_norm": 0.5865392088890076,
+      "learning_rate": 1.526708147705013e-05,
+      "loss": 0.7399,
+      "step": 77
+    },
+    {
+      "epoch": 0.38613861386138615,
+      "grad_norm": 0.6312874555587769,
+      "learning_rate": 1.4033009983067452e-05,
+      "loss": 0.8417,
+      "step": 78
+    },
+    {
+      "epoch": 0.3910891089108911,
+      "grad_norm": 0.5376201272010803,
+      "learning_rate": 1.2842758726130283e-05,
+      "loss": 0.7283,
+      "step": 79
+    },
+    {
+      "epoch": 0.39603960396039606,
+      "grad_norm": 0.6847659945487976,
+      "learning_rate": 1.1697777844051105e-05,
+      "loss": 1.3026,
+      "step": 80
+    },
+    {
+      "epoch": 0.400990099009901,
+      "grad_norm": 0.6058554649353027,
+      "learning_rate": 1.0599462319663905e-05,
+      "loss": 1.0366,
+      "step": 81
+    },
+    {
+      "epoch": 0.400990099009901,
+      "eval_loss": 1.0146892070770264,
+      "eval_runtime": 8.8755,
+      "eval_samples_per_second": 19.154,
+      "eval_steps_per_second": 2.479,
+      "step": 81
+    },
+    {
+      "epoch": 0.40594059405940597,
+      "grad_norm": 0.5856347680091858,
+      "learning_rate": 9.549150281252633e-06,
+      "loss": 1.0296,
+      "step": 82
+    },
+    {
+      "epoch": 0.41089108910891087,
+      "grad_norm": 0.6423104405403137,
+      "learning_rate": 8.548121372247918e-06,
+      "loss": 0.9968,
+      "step": 83
+    },
+    {
+      "epoch": 0.4158415841584158,
+      "grad_norm": 0.6194034814834595,
+      "learning_rate": 7.597595192178702e-06,
+      "loss": 1.0519,
+      "step": 84
+    },
+    {
+      "epoch": 0.4207920792079208,
+      "grad_norm": 0.6641719341278076,
+      "learning_rate": 6.698729810778065e-06,
+      "loss": 0.9704,
+      "step": 85
+    },
+    {
+      "epoch": 0.42574257425742573,
+      "grad_norm": 0.6337276101112366,
+      "learning_rate": 5.852620357053651e-06,
+      "loss": 0.9951,
+      "step": 86
+    },
+    {
+      "epoch": 0.4306930693069307,
+      "grad_norm": 0.6629340052604675,
+      "learning_rate": 5.060297685041659e-06,
+      "loss": 1.1703,
+      "step": 87
+    },
+    {
+      "epoch": 0.43564356435643564,
+      "grad_norm": 0.652624785900116,
+      "learning_rate": 4.322727117869951e-06,
+      "loss": 0.8394,
+      "step": 88
+    },
+    {
+      "epoch": 0.4405940594059406,
+      "grad_norm": 0.581545889377594,
+      "learning_rate": 3.6408072716606346e-06,
+      "loss": 0.7336,
+      "step": 89
+    },
+    {
+      "epoch": 0.44554455445544555,
+      "grad_norm": 0.5966439247131348,
+      "learning_rate": 3.0153689607045845e-06,
+      "loss": 1.0634,
+      "step": 90
+    },
+    {
+      "epoch": 0.44554455445544555,
+      "eval_loss": 1.0132135152816772,
+      "eval_runtime": 8.8795,
+      "eval_samples_per_second": 19.145,
+      "eval_steps_per_second": 2.478,
+      "step": 90
+    },
+    {
+      "epoch": 0.4504950495049505,
+      "grad_norm": 0.6581529378890991,
+      "learning_rate": 2.4471741852423237e-06,
+      "loss": 1.0592,
+      "step": 91
+    },
+    {
+      "epoch": 0.45544554455445546,
+      "grad_norm": 0.635265052318573,
+      "learning_rate": 1.9369152030840556e-06,
+      "loss": 1.0801,
+      "step": 92
+    },
+    {
+      "epoch": 0.4603960396039604,
+      "grad_norm": 0.5575783252716064,
+      "learning_rate": 1.4852136862001764e-06,
+      "loss": 0.9116,
+      "step": 93
+    },
+    {
+      "epoch": 0.46534653465346537,
+      "grad_norm": 0.6908242106437683,
+      "learning_rate": 1.0926199633097157e-06,
+      "loss": 0.6705,
+      "step": 94
+    },
+    {
+      "epoch": 0.47029702970297027,
+      "grad_norm": 0.548456609249115,
+      "learning_rate": 7.596123493895991e-07,
+      "loss": 0.6546,
+      "step": 95
+    },
+    {
+      "epoch": 0.4752475247524752,
+      "grad_norm": 0.6170583367347717,
+      "learning_rate": 4.865965629214819e-07,
+      "loss": 0.9413,
+      "step": 96
+    },
+    {
+      "epoch": 0.4801980198019802,
+      "grad_norm": 0.5605760216712952,
+      "learning_rate": 2.7390523158633554e-07,
+      "loss": 0.8653,
+      "step": 97
+    },
+    {
+      "epoch": 0.48514851485148514,
+      "grad_norm": 0.7761462926864624,
+      "learning_rate": 1.2179748700879012e-07,
+      "loss": 0.9508,
+      "step": 98
+    },
+    {
+      "epoch": 0.4900990099009901,
+      "grad_norm": 0.6539168953895569,
+      "learning_rate": 3.04586490452119e-08,
+      "loss": 0.9094,
+      "step": 99
+    },
+    {
+      "epoch": 0.4900990099009901,
+      "eval_loss": 1.0127954483032227,
+      "eval_runtime": 8.8872,
+      "eval_samples_per_second": 19.129,
+      "eval_steps_per_second": 2.475,
+      "step": 99
+    },
+    {
+      "epoch": 0.49504950495049505,
+      "grad_norm": 0.570722222328186,
+      "learning_rate": 0.0,
+      "loss": 0.8181,
+      "step": 100
     }
   ],
   "logging_steps": 1,
         "should_evaluate": false,
         "should_log": false,
         "should_save": true,
+        "should_training_stop": true
       },
       "attributes": {}
     }
   },
+  "total_flos": 7.41887283560448e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null