adding early stop callback to ptuning #6028

arendu · 2023-02-15T01:10:29Z

What does this PR do ?

Adds a early stopping callback to the ptl trainer object for prompt and p-tuning for gpt and t5 models.

Collection: [NLP]

Usage

You can potentially add a usage example below

# Add a code snippet demonstrating how to use this

Before your PR is "Ready for review"

Pre checks:

Make sure you read and followed Contributor guidelines
Did you write any new necessary tests?
Did you add or update any necessary documentation?
Does the PR affect components that are optional to install? (Ex: Numba, Pynini, Apex etc)
- Reviewer: Does the PR have correct import guards for all optional libraries?

PR Type:

New Feature
Bugfix
Documentation

If you haven't finished some of the above items you can still open "Draft" PR.

Who can review?

Anyone in the community is free to review the PR once the checks have passed.
Contributor guidelines contains specific people who can review PRs to various areas.

Additional Information

Related to # (issue)

… attribute Signed-off-by: arendu <adithya.r@gmail.com>

Signed-off-by: arendu <adithya.r@gmail.com>

for more information, see https://pre-commit.ci

arendu · 2023-02-15T02:15:49Z

experiment w and w/o early stop: https://wandb.ai/nvidia/earlystop?workspace=user-adithyare

Signed-off-by: arendu <adithya.r@gmail.com>

…DIA/NeMo into adithyare/early_stop_ptuning

aklife97

LGTM!

nemo/utils/exp_manager.py

titu1994 · 2023-02-16T00:17:40Z

nemo/utils/exp_manager.py

@@ -272,6 +284,7 @@ def exp_manager(trainer: 'pytorch_lightning.Trainer', cfg: Optional[Union[DictCo
                pytorch lightning trainer. The ModelCheckpoint saves the top 3 models with the best "val_loss", the most
                recent checkpoint under ``*last.ckpt``, and the final checkpoint after training completes under ``*end.ckpt``.
                Defaults to True.
+            - create_early_stopping_callback (bool): Flag to decide if early stopping should be used to stop training. Default is False. See EarlyStoppingParams dataclass above.


New line after False.

examples/nlp/language_modeling/conf/megatron_t5_prompt_learning.yaml

Signed-off-by: arendu <adithya.r@gmail.com>

for more information, see https://pre-commit.ci

Signed-off-by: arendu <adithya.r@gmail.com>

…DIA/NeMo into adithyare/early_stop_ptuning

arendu · 2023-02-16T05:00:15Z

tests/core/test_config_utils.py

@@ -126,3 +128,12 @@ def test_ptl_config(self):
        assert signatures_match
        assert cls_subset is None
        assert dataclass_subset is None
+
+    @pytest.mark.unit
+    def test_early_stopping_config(self,):


@titu1994 I can't figure out what is wrong here.

Seems to have worked out

Signed-off-by: arendu <adithya.r@gmail.com>

…DIA/NeMo into adithyare/early_stop_ptuning

titu1994

Looks great !

titu1994 · 2023-02-16T06:44:34Z

tests/core/test_config_utils.py

@@ -126,3 +128,12 @@ def test_ptl_config(self):
        assert signatures_match
        assert cls_subset is None
        assert dataclass_subset is None
+
+    @pytest.mark.unit
+    def test_early_stopping_config(self,):


Seems to have worked out

* patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com>

* gpt fix Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * per-micro-batch input loader (#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * added PR#5995 Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * Distributed Adam optimizer overlaps param all-gather with forward compute (#5684) * Add distopt support for overlapping param all-gather with forward compute Signed-off-by: Tim Moon <tmoon@nvidia.com> * Update Apex commit Signed-off-by: Tim Moon <tmoon@nvidia.com> --------- Signed-off-by: Tim Moon <tmoon@nvidia.com> Co-authored-by: Eric Harper <complex451@gmail.com> * per-micro-batch input loader (#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * adding early stop callback to ptuning (#6028) * patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com>

* update branch Signed-off-by: ericharper <complex451@gmail.com> * Tn doc 16 (#5954) * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix spelling Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add warning Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add comment Signed-off-by: Yang Zhang <yangzhang@nvidia.com> --------- Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links, add missing file (#6044) * fix link, add missing file Signed-off-by: ekmb <ebakhturina@nvidia.com> * fix primer notebook links Signed-off-by: ekmb <ebakhturina@nvidia.com> --------- Signed-off-by: ekmb <ebakhturina@nvidia.com> * Davidm/cherrypick r1.16.0 (#6082) * gpt fix Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * per-micro-batch input loader (#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * added PR#5995 Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * Distributed Adam optimizer overlaps param all-gather with forward compute (#5684) * Add distopt support for overlapping param all-gather with forward compute Signed-off-by: Tim Moon <tmoon@nvidia.com> * Update Apex commit Signed-off-by: Tim Moon <tmoon@nvidia.com> --------- Signed-off-by: Tim Moon <tmoon@nvidia.com> Co-authored-by: Eric Harper <complex451@gmail.com> * per-micro-batch input loader (#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * adding early stop callback to ptuning (#6028) * patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com> * update branch for pynini install script (#6150) Signed-off-by: ericharper <complex451@gmail.com> * update branch Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> * resolve conflict Signed-off-by: ericharper <complex451@gmail.com> * revert file add Signed-off-by: ericharper <complex451@gmail.com> * revert import Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Yang Zhang <yangzhang@nvidia.com> Signed-off-by: ekmb <ebakhturina@nvidia.com> Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: Yang Zhang <yzhang123@users.noreply.github.com> Co-authored-by: Evelina <10428420+ekmb@users.noreply.github.com> Co-authored-by: David <amosalla@asu.edu> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com>

* patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com>

* update branch Signed-off-by: ericharper <complex451@gmail.com> * Tn doc 16 (NVIDIA#5954) * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix spelling Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add warning Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add comment Signed-off-by: Yang Zhang <yangzhang@nvidia.com> --------- Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links, add missing file (NVIDIA#6044) * fix link, add missing file Signed-off-by: ekmb <ebakhturina@nvidia.com> * fix primer notebook links Signed-off-by: ekmb <ebakhturina@nvidia.com> --------- Signed-off-by: ekmb <ebakhturina@nvidia.com> * Davidm/cherrypick r1.16.0 (NVIDIA#6082) * gpt fix Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * per-micro-batch input loader (NVIDIA#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * added PR#5995 Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * Distributed Adam optimizer overlaps param all-gather with forward compute (NVIDIA#5684) * Add distopt support for overlapping param all-gather with forward compute Signed-off-by: Tim Moon <tmoon@nvidia.com> * Update Apex commit Signed-off-by: Tim Moon <tmoon@nvidia.com> --------- Signed-off-by: Tim Moon <tmoon@nvidia.com> Co-authored-by: Eric Harper <complex451@gmail.com> * per-micro-batch input loader (NVIDIA#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * adding early stop callback to ptuning (NVIDIA#6028) * patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com> * update branch for pynini install script (NVIDIA#6150) Signed-off-by: ericharper <complex451@gmail.com> * update branch Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> * resolve conflict Signed-off-by: ericharper <complex451@gmail.com> * revert file add Signed-off-by: ericharper <complex451@gmail.com> * revert import Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Yang Zhang <yangzhang@nvidia.com> Signed-off-by: ekmb <ebakhturina@nvidia.com> Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: Yang Zhang <yzhang123@users.noreply.github.com> Co-authored-by: Evelina <10428420+ekmb@users.noreply.github.com> Co-authored-by: David <amosalla@asu.edu> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com>

* update branch Signed-off-by: ericharper <complex451@gmail.com> * Tn doc 16 (NVIDIA#5954) * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix new repo links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix spelling Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add warning Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * add comment Signed-off-by: Yang Zhang <yangzhang@nvidia.com> --------- Signed-off-by: Yang Zhang <yangzhang@nvidia.com> * fix links, add missing file (NVIDIA#6044) * fix link, add missing file Signed-off-by: ekmb <ebakhturina@nvidia.com> * fix primer notebook links Signed-off-by: ekmb <ebakhturina@nvidia.com> --------- Signed-off-by: ekmb <ebakhturina@nvidia.com> * Davidm/cherrypick r1.16.0 (NVIDIA#6082) * gpt fix Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * per-micro-batch input loader (NVIDIA#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * added PR#5995 Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> * Distributed Adam optimizer overlaps param all-gather with forward compute (NVIDIA#5684) * Add distopt support for overlapping param all-gather with forward compute Signed-off-by: Tim Moon <tmoon@nvidia.com> * Update Apex commit Signed-off-by: Tim Moon <tmoon@nvidia.com> --------- Signed-off-by: Tim Moon <tmoon@nvidia.com> Co-authored-by: Eric Harper <complex451@gmail.com> * per-micro-batch input loader (NVIDIA#5635) * per-micro-batch input loader * per-micro-batch input loader set arg default val * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * minor fix * apply per-microbatch-loader to only GPT * update docstring on micro-batch input loader * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * fixed the default arg val * fix batch size to 1 at log stat registration * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update container for CI Signed-off-by: ericharper <complex451@gmail.com> * update container in jenkinsfile Signed-off-by: ericharper <complex451@gmail.com> * update container for CI Signed-off-by: ericharper <complex451@gmail.com> fix merge conflict * revert Jenkinsfile * Revert "revert Jenkinsfile" This reverts commit d23b775. * Update nemo/collections/nlp/models/language_modeling/megatron_gpt_model.py Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * add GradScaler * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> * adding early stop callback to ptuning (NVIDIA#6028) * patch to allow using tokenizers without additional_special_tokens_ids attribute Signed-off-by: arendu <adithya.r@gmail.com> * early stop callback for prompt/p tuning Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * update Signed-off-by: arendu <adithya.r@gmail.com> * added exp manager config for early stop Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * pushed logic for creating early stopping inside exp manager Signed-off-by: arendu <adithya.r@gmail.com> * minor updates and added dataclass check Signed-off-by: arendu <adithya.r@gmail.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * more args Signed-off-by: arendu <adithya.r@gmail.com> * more args Signed-off-by: arendu <adithya.r@gmail.com> --------- Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci --------- Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ericharper <complex451@gmail.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com> * update branch for pynini install script (NVIDIA#6150) Signed-off-by: ericharper <complex451@gmail.com> * update branch Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> * resolve conflict Signed-off-by: ericharper <complex451@gmail.com> * revert file add Signed-off-by: ericharper <complex451@gmail.com> * revert import Signed-off-by: ericharper <complex451@gmail.com> * revert Signed-off-by: ericharper <complex451@gmail.com> --------- Signed-off-by: ericharper <complex451@gmail.com> Signed-off-by: Yang Zhang <yangzhang@nvidia.com> Signed-off-by: ekmb <ebakhturina@nvidia.com> Signed-off-by: David Mosallanezhad <dmosallanezh@nvidia.com> Signed-off-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Signed-off-by: Tim Moon <tmoon@nvidia.com> Signed-off-by: arendu <adithya.r@gmail.com> Co-authored-by: Yang Zhang <yzhang123@users.noreply.github.com> Co-authored-by: Evelina <10428420+ekmb@users.noreply.github.com> Co-authored-by: David <amosalla@asu.edu> Co-authored-by: David Mosallanezhad <dmosallanezh@nvidia.com> Co-authored-by: Sangkug Lym <slym@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: Tim Moon <4406448+timmoon10@users.noreply.github.com> Co-authored-by: Adi Renduchintala <108822655+arendu@users.noreply.github.com> Signed-off-by: hsiehjackson <c2hsieh@ucsd.edu>

arendu added 21 commits December 15, 2022 10:51

patch to allow using tokenizers without additional_special_tokens_ids…

2b95406

… attribute Signed-off-by: arendu <adithya.r@gmail.com>

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

c131a90

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

9e15c3a

merge main

d0e3669

Signed-off-by: arendu <adithya.r@gmail.com>

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

0a19a5a

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

ec3d57b

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

64e36ba

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

5bfde7e

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

b04b145

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

b1906ab

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

9795062

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

0f83085

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

ee4dd1a

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

53ba0b2

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

a6aee2a

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

33442d4

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

8e6c5c9

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

efd263c

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

ecfda4f

Merge branch 'main' of https://github.com/NVIDIA/NeMo into main

15aee0c

early stop callback for prompt/p tuning

3fe8e34

Signed-off-by: arendu <adithya.r@gmail.com>

arendu requested a review from Davood-M February 15, 2023 01:10

github-actions bot added the NLP label Feb 15, 2023

arendu requested review from aklife97 and okuchaiev February 15, 2023 01:10

[pre-commit.ci] auto fixes from pre-commit.com hooks

0d2666c

for more information, see https://pre-commit.ci

Merge branch 'main' into adithyare/early_stop_ptuning

1af3e79

arendu marked this pull request as ready for review February 15, 2023 02:34

update

ecbb118

Signed-off-by: arendu <adithya.r@gmail.com>

arendu added 2 commits February 15, 2023 13:43

pushed logic for creating early stopping inside exp manager

6ae6188

Signed-off-by: arendu <adithya.r@gmail.com>

Merge branch 'adithyare/early_stop_ptuning' of https://github.com/NVI…

0aefe59

…DIA/NeMo into adithyare/early_stop_ptuning

aklife97 previously approved these changes Feb 15, 2023

View reviewed changes

titu1994 reviewed Feb 16, 2023

View reviewed changes

minor updates and added dataclass check

2f1111d

Signed-off-by: arendu <adithya.r@gmail.com>

arendu dismissed aklife97’s stale review via 2f1111d February 16, 2023 03:52

pre-commit-ci bot and others added 4 commits February 16, 2023 03:53

[pre-commit.ci] auto fixes from pre-commit.com hooks

60e0d25

for more information, see https://pre-commit.ci

more args

2b8d254

Signed-off-by: arendu <adithya.r@gmail.com>

Merge branch 'adithyare/early_stop_ptuning' of https://github.com/NVI…

cac3df9

…DIA/NeMo into adithyare/early_stop_ptuning

Merge branch 'main' into adithyare/early_stop_ptuning

2f35842

arendu commented Feb 16, 2023

View reviewed changes

arendu added 2 commits February 15, 2023 21:08

more args

a176efb

Signed-off-by: arendu <adithya.r@gmail.com>

Merge branch 'adithyare/early_stop_ptuning' of https://github.com/NVI…

c31d4aa

…DIA/NeMo into adithyare/early_stop_ptuning

arendu requested review from titu1994, mbitaab, Davood-M and aklife97 and removed request for mbitaab February 16, 2023 05:10

titu1994 approved these changes Feb 16, 2023

View reviewed changes

titu1994 merged commit ccaf908 into main Feb 16, 2023

titu1994 deleted the adithyare/early_stop_ptuning branch February 16, 2023 06:44

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

adding early stop callback to ptuning #6028

adding early stop callback to ptuning #6028

arendu commented Feb 15, 2023 •

edited

Loading

arendu commented Feb 15, 2023

aklife97 left a comment

titu1994 Feb 16, 2023

arendu Feb 16, 2023

titu1994 Feb 16, 2023

titu1994 left a comment

titu1994 Feb 16, 2023

adding early stop callback to ptuning #6028

adding early stop callback to ptuning #6028

Conversation

arendu commented Feb 15, 2023 • edited Loading

What does this PR do ?

Usage

Before your PR is "Ready for review"

Who can review?

Additional Information

arendu commented Feb 15, 2023

aklife97 left a comment

Choose a reason for hiding this comment

titu1994 Feb 16, 2023

Choose a reason for hiding this comment

arendu Feb 16, 2023

Choose a reason for hiding this comment

titu1994 Feb 16, 2023

Choose a reason for hiding this comment

titu1994 left a comment

Choose a reason for hiding this comment

titu1994 Feb 16, 2023

Choose a reason for hiding this comment

arendu commented Feb 15, 2023 •

edited

Loading