NLP预训练模型分层学习率衰减

最新推荐文章于 2024-09-05 10:39:02 发布

原创最新推荐文章于 2024-09-05 10:39:02 发布 · 847 阅读

3 ·

CC 4.0 BY-SA版权

nlp 同时被 2 个专栏收录

11 篇文章

订阅专栏

人工智能

5 篇文章

订阅专栏

# ref: <How to Fine-Tune BERT for Text Classification? >
    from transformers import AdamW
    # 分层学习率衰减
    # 基础学习率
    lr_base = 5e-6
    lr_classifier = 5e-5
    # 衰减系数
    xi = 0.95

    lr = dict()
    lr[23] = lr_base
    for k in range(23,0,-1):
        lr[k-1] = 0.95*lr[k]
    print('lr_decay: ', lr)

    adamw_lr = [{"params": model.roberta.encoder.layer[i].parameters(), "lr": lr[i]} for i in range(24)]
    adamw_lr.append({"params": model.classifier.parameters(),"lr": lr_classifier})
    print(adamw_lr)
    optimizer = AdamW(
        adamw_lr,
        lr=lr_classifier
    )
    # 在finetune时使用这个optimizer

根据论文<How to Fine-Tune BERT for Text Classification? >