快捷方式

torchtext.datasets

警告

torchtext 支持的数据集是来自 torchdata 项目 的 DataPipe,目前仍处于 Beta 阶段。这意味着 API 可能会在没有弃用周期的情况下发生变化。特别是,我们预计随着 torchdataDataLoaderV2 的最终发布,当前的许多用法将会发生变化。

以下是关于使用 DataPipe 的一些建议:

  • 若要对 DataPipe 进行洗牌(shuffling),请在 DataLoader 中进行:DataLoader(dp, shuffle=True)。你无需调用 dp.shuffle(),因为 torchtext 已经为你完成了。但请注意,除非你显式地将 shuffle=True 传递给 DataLoader,否则 DataPipe 不会被洗牌。

  • 当使用多进程(num_workers=N)时,请使用内置的 worker_init_fn

    from torch.utils.data.backward_compatibility import worker_init_fn
    DataLoader(dp, num_workers=4, worker_init_fn=worker_init_fn, drop_last=True)
    

    这将确保数据不会在不同工作进程(worker)之间重复。

  • 我们还建议使用 drop_last=True。如果不这样做,在某些情况下 epoch 末尾的 batch 大小可能会非常小(比其他映射式(map-style)数据集更小)。这可能会极大地影响准确率,特别是在使用 batch-norm 时。drop_last=True 可确保所有 batch 大小相等。

  • 使用 DistributedDataParallel 进行分布式训练目前尚不完全稳定/受支持,因此我们目前不建议这样做。在 DataLoaderV2 中将会得到更好的支持。如果你仍希望使用 DDP,请确保:

    • 所有工作进程(DDP worker 和 DataLoader worker)看到的是数据的不同部分。数据集已经包装在 ShardingFilter 中,你可能需要调用 dp.apply_sharding(num_shards, shard_id) 以便在各个分片(DDP worker)和 DataLoader worker 之间切分数据。一种实现方法是创建一个 worker_init_fn,调用带有适当分片数量(DDP worker * DataLoader worker)和分片 ID(通过 rank 和相应 DataLoader 的 worker ID 推断得出)的 apply_sharding。不过请注意,这假设所有 rank 的 DataLoader worker 数量相等。

    • 所有 DDP worker 处理相同数量的 batch。一种方法是将每个 worker 内的 DataPipe 大小限制为 len(datapipe) // num_ddp_workers,但这可能并不适用于所有用例。

    • 所有 worker 的洗牌种子(shuffling seed)相同。你可能需要调用 torch.utils.data.graph_settings.apply_shuffle_seed(dp, rng)

    • 洗牌种子在不同 epoch 之间是不同的。

    • 其余的 RNG(通常用于转换)在不同 worker 之间是不同的,以实现最大程度的熵和最佳的准确性。

一般使用案例如下:

# import datasets
from torchtext.datasets import IMDB

train_iter = IMDB(split='train')

def tokenize(label, line):
    return line.split()

tokens = []
for label, line in train_iter:
    tokens += tokenize(label, line)

目前提供以下数据集。如果你想向存储库贡献新的数据集,或者使用你自己的自定义数据集,请参阅 CONTRIBUTING_DATASETS.md 指南。

文本分类

AG_NEWS

torchtext.datasets.AG_NEWS(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

AG_NEWS 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://paperswithcode.com/dataset/ag-news

每个拆分(split)的行数
  • train: 120000

  • test: 7600

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 4)和文本元组的 DataPipe

返回类型:

(int, str)

AmazonReviewFull

torchtext.datasets.AmazonReviewFull(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

AmazonReviewFull 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 3000000

  • test: 650000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 5)和包含评论标题及正文的文本元组的 DataPipe

返回类型:

(int, str)

AmazonReviewPolarity

torchtext.datasets.AmazonReviewPolarity(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

AmazonReviewPolarity 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 3600000

  • test: 400000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 2)和包含评论标题及正文的文本元组的 DataPipe

返回类型:

(int, str)

CoLA

torchtext.datasets.CoLA(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'dev', 'test'))[source]

CoLA 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://nyu-mll.github.io/CoLA/

每个拆分(split)的行数
  • train: 8551

  • dev: 527

  • test: 516

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生 CoLA 数据集行(来源 (str), 标签 (int), 句子 (str))的 DataPipe

返回类型:

(str, int, str)

DBpedia

torchtext.datasets.DBpedia(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

DBpedia 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://www.dbpedia.org/resources/latest-core/

每个拆分(split)的行数
  • train: 560000

  • test: 70000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 14)和包含新闻标题及内容的文本元组的 DataPipe

返回类型:

(int, str)

IMDb

torchtext.datasets.IMDB(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

IMDB 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 http://ai.stanford.edu/~amaas/data/sentiment/

每个拆分(split)的行数
  • train: 25000

  • test: 25000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 2)和包含电影评论的文本元组的 DataPipe

返回类型:

(int, str)

使用 IMDB 的教程
T5-Base Model for Summarization, Sentiment Classification, and Translation

用于摘要、情感分类和翻译的 T5-Base 模型

用于摘要、情感分类和翻译的 T5-Base 模型

MNLI

torchtext.datasets.MNLI(root='.data', split=('train', 'dev_matched', 'dev_mismatched'))[source]

MNLI 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://cims.nyu.edu/~sbowman/multinli/

每个拆分(split)的行数
  • train: 392702

  • dev_matched: 9815

  • dev_mismatched: 9832

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev_matched, dev_mismatched)

返回:

产生文本和标签(0 到 2)元组的 DataPipe。

返回类型:

Tuple[int, str, str]

MRPC

torchtext.datasets.MRPC(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

MRPC 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://www.microsoft.com/en-us/download/details.aspx?id=52398

每个拆分(split)的行数
  • train: 4076

  • test: 1725

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生 MRPC 数据集数据点的 DataPipe,包括标签、句子1、句子2

返回类型:

(int, str, str)

QNLI

torchtext.datasets.QNLI(root='.data', split=('train', 'dev', 'test'))[source]

QNLI 数据集

有关详细信息,请参阅 https://arxiv.org/pdf/1804.07461.pdf(来自 GLUE 论文)

每个拆分(split)的行数
  • train: 104743

  • dev: 5463

  • test: 5463

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生文本和标签(0 和 1)元组的 DataPipe。

返回类型:

(int, str, str)

QQP

torchtext.datasets.QQP(root: str)[source]

QQP 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://quoradata.quora.com/First-Quora-Dataset-Release-Question-Pairs

参数:

root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

返回:

产生 QQP 数据集行(标签 (int), 问题1 (str), 问题2 (str))的 DataPipe

返回类型:

(int, str, str)

RTE

torchtext.datasets.RTE(root='.data', split=('train', 'dev', 'test'))[source]

RTE 数据集

有关详细信息,请参阅 https://aclweb.org/aclwiki/Recognizing_Textual_Entailment

每个拆分(split)的行数
  • train: 2490

  • dev: 277

  • test: 3000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生文本和/或标签(0 和 1)元组的 DataPipe。test 拆分仅返回文本。

返回类型:

Union[(int, str, str), (str, str)]

SogouNews

torchtext.datasets.SogouNews(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

SogouNews 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 450000

  • test: 60000

参数 (Args)

root: 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’) split: 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 5)和包含新闻标题及内容的文本元组的 DataPipe

返回类型:

(int, str)

SST2

torchtext.datasets.SST2(root='.data', split=('train', 'dev', 'test'))[source]

SST2 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://nlp.stanford.edu/sentiment/

每个拆分(split)的行数
  • train: 67349

  • dev: 872

  • test: 1821

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生文本和/或标签(1 到 4)元组的 DataPipe。test 拆分仅返回文本。

返回类型:

Union[(int, str), (str,)]

使用 SST2 的教程
SST-2 Binary text classification with XLM-RoBERTa model

使用 XLM-RoBERTa 模型进行 SST-2 二元文本分类

使用 XLM-RoBERTa 模型进行 SST-2 二元文本分类

STSB

torchtext.datasets.STSB(root='.data', split=('train', 'dev', 'test'))[source]

STSB 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://ixa2.si.ehu.eus/stswiki/index.php/STSbenchmark

每个拆分(split)的行数
  • train: 5749

  • dev: 1500

  • test: 1379

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生 (索引 (int), 标签 (float), 句子1 (str), 句子2 (str)) 元组的 DataPipe

返回类型:

(int, float, str, str)

WNLI

torchtext.datasets.WNLI(root='.data', split=('train', 'dev', 'test'))[source]

WNLI 数据集

有关详细信息,请参阅 https://arxiv.org/pdf/1804.07461v3.pdf

每个拆分(split)的行数
  • train: 635

  • dev: 71

  • test: 146

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev, test)

返回:

产生文本和/或标签(0 到 1)元组的 DataPipe。test 拆分仅返回文本。

返回类型:

Union[(int, str, str), (str, str)]

YahooAnswers

torchtext.datasets.YahooAnswers(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

YahooAnswers 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 1400000

  • test: 60000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 10)和包含问题标题、问题内容及最佳答案的文本元组的 DataPipe

返回类型:

(int, str)

YelpReviewFull

torchtext.datasets.YelpReviewFull(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

YelpReviewFull 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 650000

  • test: 50000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 5)和包含评论的文本元组的 DataPipe

返回类型:

(int, str)

YelpReviewPolarity

torchtext.datasets.YelpReviewPolarity(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

YelpReviewPolarity 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://arxiv.org/abs/1509.01626

每个拆分(split)的行数
  • train: 560000

  • test: 38000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生标签(1 到 2)和包含评论的文本元组的 DataPipe

返回类型:

(int, str)

语言模型(Language Modeling)

PennTreebank

torchtext.datasets.PennTreebank(root='.data', split: Union[Tuple[str], str] = ('train', 'valid', 'test'))[source]

PennTreebank 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://catalog.ldc.upenn.edu/docs/LDC95T7/cl93.html

每个拆分(split)的行数
  • train: 42068

  • valid: 3370

  • test: 3761

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, valid, test)

返回:

从 Treebank 语料库产生文本的 DataPipe

返回类型:

str

WikiText-2

torchtext.datasets.WikiText2(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'valid', 'test'))[source]

WikiText2 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://blog.salesforceairesearch.com/the-wikitext-long-term-dependency-language-modeling-dataset/

每个拆分(split)的行数
  • train: 36718

  • valid: 3760

  • test: 4358

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, valid, test)

返回:

产生维基百科文章文本的 DataPipe

返回类型:

str

WikiText103

torchtext.datasets.WikiText103(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'valid', 'test'))[source]

WikiText103 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://blog.salesforceairesearch.com/the-wikitext-long-term-dependency-language-modeling-dataset/

每个拆分(split)的行数
  • train: 1801350

  • valid: 3760

  • test: 4358

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, valid, test)

返回:

产生维基百科文章文本的 DataPipe

返回类型:

str

机器翻译(Machine Translation)

IWSLT2016

torchtext.datasets.IWSLT2016(root='.data', split=('train', 'valid', 'test'), language_pair=('de', 'en'), valid_set='tst2013', test_set='tst2014')[source]

IWSLT2016 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://wit3.fbk.eu/2016-01

可用数据集包括以下

语言对:

“en”

“fr”

“de”

“cs”

“ar”

“en”

x

x

x

x

“fr”

x

“de”

x

“cs”

x

“ar”

x

验证/测试集: [“dev2010”, “tst2010”, “tst2011”, “tst2012”, “tst2013”, “tst2014”]

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(‘train’, ‘valid’, ‘test’)

  • language_pair – 包含源语言和目标语言的元组或列表

  • valid_set – 用于标识验证集的字符串。

  • test_set – 用于标识测试集的字符串。

返回:

产生源语言和目标语言句子元组的 DataPipe

返回类型:

(str, str)

示例

>>> from torchtext.datasets import IWSLT2016
>>> train_iter, valid_iter, test_iter = IWSLT2016()
>>> src_sentence, tgt_sentence = next(iter(train_iter))

IWSLT2017

torchtext.datasets.IWSLT2017(root='.data', split=('train', 'valid', 'test'), language_pair=('de', 'en'))[source]

IWSLT2017 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://wit3.fbk.eu/2017-01

可用数据集包括以下

语言对:

“en”

“nl”

“de”

“it”

“ro”

“en”

x

x

x

x

“nl”

x

x

x

x

“de”

x

x

x

x

“it”

x

x

x

x

“ro”

x

x

x

x

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(‘train’, ‘valid’, ‘test’)

  • language_pair – 包含源语言和目标语言的元组或列表

返回:

产生源语言和目标语言句子元组的 DataPipe

返回类型:

(str, str)

示例

>>> from torchtext.datasets import IWSLT2017
>>> train_iter, valid_iter, test_iter = IWSLT2017()
>>> src_sentence, tgt_sentence = next(iter(train_iter))

Multi30k

torchtext.datasets.Multi30k(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'valid', 'test'), language_pair: Tuple[str] = ('de', 'en'))[source]

Multi30k 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://www.statmt.org/wmt16/multimodal-task.html#task1

每个拆分(split)的行数
  • train: 29000

  • valid: 1014

  • test: 1000

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(‘train’, ‘valid’, ‘test’)

  • language_pair – 包含源语言和目标语言的元组或列表。可用选项为 (‘de’,’en’) 和 (‘en’, ‘de’)

返回:

产生源语言和目标语言句子元组的 DataPipe

返回类型:

(str, str)

使用 Multi30k 的教程
T5-Base Model for Summarization, Sentiment Classification, and Translation

用于摘要、情感分类和翻译的 T5-Base 模型

用于摘要、情感分类和翻译的 T5-Base 模型

序列标注(Sequence Tagging)

CoNLL2000Chunking

torchtext.datasets.CoNLL2000Chunking(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'test'))[source]

CoNLL2000Chunking 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://www.clips.uantwerpen.be/conll2000/chunking/

每个拆分(split)的行数
  • train: 8936

  • test: 2012

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, test)

返回:

产生单词列表及其对应的词性标注和分块标签的 DataPipe

返回类型:

[list(str), list(str), list(str)]

UDPOS

torchtext.datasets.UDPOS(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'valid', 'test'))[source]

UDPOS 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

每个拆分(split)的行数
  • train: 12543

  • valid: 2002

  • test: 2077

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, valid, test)

返回:

产生单词列表及其对应的词性标注的 DataPipe

返回类型:

[list(str), list(str)]

问答(Question Answer)

SQuAD 1.0

torchtext.datasets.SQuAD1(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'dev'))[source]

SQuAD1 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://rajpurkar.github.io/SQuAD-explorer/

每个拆分(split)的行数
  • train: 87599

  • dev: 10570

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev)

返回:

产生 SQuAD1 数据集数据点的 DataPipe,包括上下文、问题、答案列表以及在上下文中的对应索引

返回类型:

(str, str, list(str), list(int))

SQuAD 2.0

torchtext.datasets.SQuAD2(root: str = '.data', split: Union[Tuple[str], str] = ('train', 'dev'))[source]

SQuAD2 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://rajpurkar.github.io/SQuAD-explorer/

每个拆分(split)的行数
  • train: 130319

  • dev: 11873

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • split – 要返回的拆分。可以是字符串或字符串元组。默认:(train, dev)

返回:

产生 SQuAD1 数据集数据点的 DataPipe,包括上下文、问题、答案列表以及在上下文中的对应索引

返回类型:

(str, str, list(str), list(int))

无监督学习(Unsupervised Learning)

CC100

torchtext.datasets.CC100(root: str, language_code: str = 'en')[source]

CC100 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 https://data.statmt.org/cc-100/

参数:
  • root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

  • language_code – 数据集的语言

返回:

产生语言代码和文本元组的 DataPipe

返回类型:

(str, str)

EnWik9

torchtext.datasets.EnWik9(root: str)[source]

EnWik9 数据集

警告

目前使用 DataPipe 仍有一些注意事项。如果你希望在洗牌、多进程或分布式学习中使用此数据集,请参阅 此说明 获取进一步指导。

有关详细信息,请参阅 http://mattmahoney.net/dc/textdata.html

数据集中行数: 13147026

参数:

root – 保存数据集的目录。默认:os.path.expanduser(‘~/.torchtext/cache’)

返回:

产生 WnWik9 数据集原始文本行的 DataPipe

返回类型:

str

文档

访问全面的 PyTorch 开发者文档

查看文档

教程

为初学者和高级开发者提供深入的教程

查看教程

资源

查找开发资源并让您的问题得到解答

查看资源