Training in progress, step 340, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +91 -5

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:4bd871ffaaf005b4ae82e3fe0574e188d290bd56611e88b2ee15dcc1170f10b7
 size 125048

 version https://git-lfs.github.com/spec/v1
+oid sha256:a8791fae23023cf2106e0168a68fe7cfc76cf5009e3729f4af35acf290bf1f97
 size 125048

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:b3f145bed0430746d11b64162710df80efd4565776390d51f03bf26c95c602c2
 size 162868

 version https://git-lfs.github.com/spec/v1
+oid sha256:715153c301e34bc9e1ba77f1996ccb2e9a6de47d2fddaab7f57690744eaa6ccb
 size 162868

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:26b546f9e36af2b502a1f657b47e744aea84f04f078ad1d8590bd9010e8547d4
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:1e92355acea1d637dfee0848ce97e0a35db7f2918dda84a5212f2ddf67f03a2c
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:319ff6bc537233144a9a1321d603147241bbe6a5f63a69d9ed8b2711e764b26e
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:fc3b597e507c818a1b809c10b26354c2c68ff2bc801d315b5aadc95eb0081237
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
-  "best_metric": 11.018866539001465,
-  "best_model_checkpoint": "miner_id_24/checkpoint-330",
-  "epoch": 0.01491491717701295,
   "eval_steps": 5,
-  "global_step": 330,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -2853,6 +2853,92 @@
       "eval_samples_per_second": 52.813,
       "eval_steps_per_second": 26.409,
       "step": 330
     }
   ],
   "logging_steps": 1,
@@ -2881,7 +2967,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 3467221401600.0,
   "train_batch_size": 2,
   "trial_name": null,
   "trial_params": null

 {
+  "best_metric": 11.018733024597168,
+  "best_model_checkpoint": "miner_id_24/checkpoint-340",
+  "epoch": 0.01536688436419516,
   "eval_steps": 5,
+  "global_step": 340,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "eval_samples_per_second": 52.813,
       "eval_steps_per_second": 26.409,
       "step": 330
+    },
+    {
+      "epoch": 0.01496011389573117,
+      "grad_norm": 0.503404438495636,
+      "learning_rate": 5.317869004397544e-05,
+      "loss": 44.0551,
+      "step": 331
+    },
+    {
+      "epoch": 0.015005310614449392,
+      "grad_norm": 0.5667140483856201,
+      "learning_rate": 5.261313375270014e-05,
+      "loss": 44.1005,
+      "step": 332
+    },
+    {
+      "epoch": 0.015050507333167613,
+      "grad_norm": 0.4343127906322479,
+      "learning_rate": 5.2049525349894625e-05,
+      "loss": 44.0367,
+      "step": 333
+    },
+    {
+      "epoch": 0.015095704051885834,
+      "grad_norm": 0.4030550420284271,
+      "learning_rate": 5.148788800329278e-05,
+      "loss": 44.0094,
+      "step": 334
+    },
+    {
+      "epoch": 0.015140900770604053,
+      "grad_norm": 0.7541276812553406,
+      "learning_rate": 5.092824479960625e-05,
+      "loss": 44.0686,
+      "step": 335
+    },
+    {
+      "epoch": 0.015140900770604053,
+      "eval_loss": 11.018802642822266,
+      "eval_runtime": 176.1322,
+      "eval_samples_per_second": 52.898,
+      "eval_steps_per_second": 26.452,
+      "step": 335
+    },
+    {
+      "epoch": 0.015186097489322275,
+      "grad_norm": 0.4742172360420227,
+      "learning_rate": 5.0370618743575026e-05,
+      "loss": 44.0855,
+      "step": 336
+    },
+    {
+      "epoch": 0.015231294208040496,
+      "grad_norm": 0.4134741723537445,
+      "learning_rate": 4.981503275702227e-05,
+      "loss": 44.0928,
+      "step": 337
+    },
+    {
+      "epoch": 0.015276490926758717,
+      "grad_norm": 0.6316869258880615,
+      "learning_rate": 4.92615096779118e-05,
+      "loss": 44.0649,
+      "step": 338
+    },
+    {
+      "epoch": 0.015321687645476938,
+      "grad_norm": 0.4112119674682617,
+      "learning_rate": 4.87100722594094e-05,
+      "loss": 44.0769,
+      "step": 339
+    },
+    {
+      "epoch": 0.01536688436419516,
+      "grad_norm": 0.4423971474170685,
+      "learning_rate": 4.8160743168947496e-05,
+      "loss": 44.059,
+      "step": 340
+    },
+    {
+      "epoch": 0.01536688436419516,
+      "eval_loss": 11.018733024597168,
+      "eval_runtime": 176.2897,
+      "eval_samples_per_second": 52.85,
+      "eval_steps_per_second": 26.428,
+      "step": 340
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 3572288716800.0,
   "train_batch_size": 2,
   "trial_name": null,
   "trial_params": null