Dialog Corpus:用于训练中英文对话系统的语料库

企鹅群


仅聊天, 其余勿加(礼貌)…

本站没有任何公众号,抖音,B站等账号,如有发现全部是骗子,请小伙们谨慎!

Dialog_Corpus:用于训练中英文对话系统的语料库/Datasets for Training Chatbot System,一个GitHub的项目,作者收集了一些从网络中找到的用于训练中文(英文)聊天机器人的对话语料,主要是一些公开的资料,ZCJUN小编看了一下有点年纪了,5年前,不过没关系,还是有效的,下面是目录,有需求的可以前往查阅。

中英文对话系统的语料库目录

  1. dgk_shooter_min.conv.zip
    中文电影对白语料,噪音比较大,许多对白问答关系没有对应好

  2. The NUS SMS Corpus
    包含中文和英文短信息语料,据说是世界最大公开的短消息语料

  3. ChatterBot中文基本聊天语料
    ChatterBot聊天引擎提供的一点基本中文聊天语料,量很少,但质量比较高

  4. Datasets for Natural Language Processing
    这是他人收集的自然语言处理相关数据集,主要包含Question Answering,Dialogue Systems, Goal-Oriented Dialogue Systems三部分,都是英文文本。可以使用机器翻译为中文,供中文对话使用

  5. 小黄鸡
    据传这就是小黄鸡的语料:xiaohuangji50w_fenciA.conv.zip (已分词) 和 xiaohuangji50w_nofenci.conv.zip (未分词)

  6. 白鹭时代中文问答语料
    由白鹭时代官方论坛问答板块10,000+ 问题中,选择被标注了“最佳答案”的纪录汇总而成。人工review raw data,给每一个问题,一个可以接受的答案。目前,语料库只包含2907个问答。(备份)

  7. Chat corpus repository
    chat corpus collection from various open sources
    包括:开放字幕、英文电影字幕、中文歌词、英文推文

  8. 保险行业QA语料库
    通过翻译 insuranceQA产生的数据集。train_data含有问题12,889条,数据 141779条,正例:负例 = 1:10; test_data含有问题2,000条,数据 22000条,正例:负例 = 1:10;valid_data含有问题2,000条,数据 22000条,正例:负例 = 1:10

中英文对话系统的语料库地址

Dialog Corpus:https://github.com/candlewill/Dialog_Corpus

 

免责声明:

本站提供的资源,都来自网络,版权争议与本站无关,所有内容及软件的文章仅限用于学习和研究目的。不得将上述内容用于商业或者非法用途,否则,一切后果请用户自负,我们不保证内容的长久可用性,通过使用本站内容随之而来的风险与本站无关,您必须在下载后的24个小时之内,从您的电脑/手机中彻底删除上述内容。如果您喜欢该程序,请支持正版软件,购买注册,得到更好的正版服务。侵删请致信E-mail:i@zcjun.com

其他:  侵删处理  – 关于本站   –  版权声明  –  隐私政策

推荐

免费在线文件转换器-CloudConvert

2023-2-26 22:45:35

推荐

B站 bilibili经验助手 自动投币升级

2023-2-28 20:11:58

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧