mindspore2022/docs/api/api_python/dataset/mindspore.dataset.text.Voca...

66 lines
4.3 KiB
ReStructuredText
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

mindspore.dataset.text.Vocab
=============================
.. py:class:: mindspore.dataset.text.Vocab
用于查找单词的vocab对象。
它包含一个映射将每个单词str映射到一个IDint
.. py:method:: from_dataset(dataset, columns=None, freq_range=None, top_k=None, special_tokens=None, special_first=True)
通过数据集构建vocab对象。
这将收集数据集中的所有唯一单词并在freq_range中用户指定的频率范围内返回一个vocab。如果没有单词在该频率上用户将收到预警信息。
vocab中的单词按最高频率到最低频率的顺序进行排列。具有相同频率的单词将按词典顺序进行排列。
**参数:**
- **dataset** (Dataset) - 表示要从中构建vocab的数据集。
- **columns** (list[str],可选) - 表示要从中获取单词的列名。它可以是列名的列表默认值None。如果没有列是string类型将返回错误。
- **freq_range** (tuple可选) - 表示整数元组min_frequencymax_frequency。频率范围内的单词将被保留。0 <= min_frequency <= max_frequency <= total_words。min_frequency=0等同于min_frequency=1。max_frequency > total_words等同于max_frequency = total_words。min_frequency和max_frequency可以为None分别对应于0和total_words默认值None。
- **top_k** (int可选) - `top_k` 大于0。要在vocab中 `top_k` 建立的单词数量表示取用最频繁的单词。 `top_k``freq_range` 之后取用。如果没有足够的 `top_k` ,所有单词都将被取用,默认值None。
- **special_tokens** (list可选) - 表示字符串列表。每个字符串都是一个特殊的标记。例如special_tokens=["<pad>","<unk>"]默认值None表示不添加特殊标记。
- **Special_first** (bool可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True则添加special_tokens默认值True。
**返回:**
表示从数据集构建的vocab。
.. py:method:: from_dict(word_dict)
从dict中构建vocab对象。
**参数:**
- **word_dict** (dict) - 字典包含word和ID对其中 `word` 应是string类型 `ID` 应是int类型。至于 `ID` 建议从0开始并且不断续。如果 `ID` 为负数将引发ValueError。
**返回:**
Vocab表示从 `dict` 构建的vocab对象。
.. py:method:: from_file(file_path, delimiter='', vocab_size=None, special_tokens=None, special_first=True)
从单词列表构建一个vocab对象。
**参数:**
- **file_path** (str) - 表示包含vocab列表的文件的路径。
- **delimiter** (str可选) - 表示用来分隔文件中每一行的分隔符。第一个元素被视为单词,默认值:""。
- **vocab_size** (int可选) - 表示要从 `file_path` 读取的字数默认值None表示读取所有的字。
- **special_tokens** (list可选) - 表示字符串的列表。每个字符串都是一个特殊标记例如special_tokens=["<pad>","<unk>"]默认值None表示不添加特殊标记
- **special_first** (list可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True则添加 `special_tokens` 默认值True。
**返回:**
Vocab表示从文件构建的vocab。
.. py:method:: from_list(word_list, special_tokens=None, special_first=True)
从单词列表构建一个vocab对象。
**参数:**
- **word_list** (list) - 表示字符串列表其中每个元素都是type类型的单词。
- **special_tokens** (list可选) - 表示字符串的列表。每个字符串都是一个特殊标记例如special_tokens=["<pad>","<unk>"]默认值None表示不添加特殊标记。
- **Special_first** (bool可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True则添加 `special_tokens` 默认值True。
**返回:**
Vocab表示从 `list` 构建的vocab。