nlp_task2

colab 资源

!nvidia-smi
显卡.png

挂载google drive运行

from google.colab import drive
drive.mount('/content/drive')

更改当前目录

import os
os.chdir("/content/drive/MyDrive/Colab Notebooks/nlp_task")

数据EDA

1.查看句子长度

# 数据EDA
# 1.查看句子长度
print("times",times_train['content'].str.len().describe(percentiles = [.95, .98, .99]),'\n'
      "ocemo_content",ocemo_train['content'].str.len().describe(percentiles = [.95, .98, .99]),'\n'
      "ocnli_content1",ocnli_train['content1'].str.len().describe(percentiles = [.95, .98, .99]),'\n'
      "ocnli_content2",ocnli_train['content2'].str.len().describe(percentiles = [.95, .98, .99]))
# 设置bert序列长度为142的时候可覆盖99%子句的全部

2.样本均衡情况


baseline 提升策略

  1. 修改loss 使用 dtp Dynamic Task Prioritization for Multitask Learning

  2. 修改pretrained_model 换用 chinese-roberta-wwm-ext
    与训练模型修改方法:
    1.从Hugging Face中下载roberta pretrained 模型库

    roberta.png

    中文-roberta的base-model为bert

  3. 修改train.py 中的相关目录:


    image.png
最后编辑于 :
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 一、Python简介和环境搭建以及pip的安装 4课时实验课主要内容 【Python简介】: Python 是一个...
    _小老虎_阅读 6,400评论 0赞 10
  • .bat脚本基本命令语法 目录 批处理的常见命令(未列举的命令还比较多,请查阅帮助信息) 1、REM 和 :: 2...
    庆庆庆庆庆阅读 8,602评论 1赞 19
  • 最近初略的看完了《批处理标准教程-MHL版本》,把教程中的一些对我有帮助的资料转为MD格式,就当是做个笔记,加深记...
    禾白小三飘阅读 1,671评论 1赞 7
  • [TOC] ##Assoc 显示或修改文件扩展名关联 Assoc [.Ext[=[Filetype]]] .Ex...
    btijjj阅读 502评论 0赞 1
  • 一、基础语法: 1.批处理文件是一个“.bat”结尾的文本文件,这个文件的每一行都是一条DOS命令。可以使用任何文...
    蒋_Sir阅读 9,461评论 1赞 4

友情链接更多精彩内容