forked from huawei/mindspore2022
!31039 Vocab Chinese and English document alignment
Merge pull request !31039 from 刘勇琪/master
This commit is contained in:
commit
f43f7fa5ad
|
|
@ -20,8 +20,8 @@
|
|||
- **columns** (list[str],可选) - 表示要从中获取单词的列名。它可以是列名的列表,默认值:None。如果没有列是string类型,将返回错误。
|
||||
- **freq_range** (tuple,可选) - 表示整数元组(min_frequency,max_frequency)。频率范围内的单词将被保留。0 <= min_frequency <= max_frequency <= total_words。min_frequency=0等同于min_frequency=1。max_frequency > total_words等同于max_frequency = total_words。min_frequency和max_frequency可以为None,分别对应于0和total_words,默认值:None。
|
||||
- **top_k** (int,可选) - `top_k` 大于0。要在vocab中 `top_k` 建立的单词数量表示取用最频繁的单词。 `top_k` 在 `freq_range` 之后取用。如果没有足够的 `top_k` ,所有单词都将被取用,默认值:None。
|
||||
- **special_tokens** (list,可选) - 表示字符串列表。每个字符串都是一个特殊的标记。例如,special_tokens=["<pad>","<unk>"],默认值:None,表示不添加特殊标记。
|
||||
- **special_first** (bool,可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True,则添加special_tokens,默认值:True。
|
||||
- **special_tokens** (list,可选) - 特殊分词列表,如常用的"[PAD]"、"[UNK]"等。默认值:None,表示不添加特殊分词(token)。
|
||||
- **special_first** (bool,可选) - 表示是否将 `special_tokens` 中的特殊分词添加到词典的最前面。如果为True则将 `special_tokens` 添加到词典的最前,否则添加到词典的最后。默认值:True。
|
||||
|
||||
**返回:**
|
||||
|
||||
|
|
@ -48,24 +48,55 @@
|
|||
- **file_path** (str) - 表示包含vocab列表的文件的路径。
|
||||
- **delimiter** (str,可选) - 表示用来分隔文件中每一行的分隔符。第一个元素被视为单词,默认值:""。
|
||||
- **vocab_size** (int,可选) - 表示要从 `file_path` 读取的字数,默认值:None,表示读取所有的字。
|
||||
- **special_tokens** (list,可选) - 表示字符串的列表。每个字符串都是一个特殊标记,例如special_tokens=["<pad>","<unk>"],默认值:None,表示不添加特殊标记)。
|
||||
- **special_first** (list,可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True,则添加 `special_tokens` ,默认值:True。
|
||||
- **special_tokens** (list,可选) - 特殊分词列表,如常用的"[PAD]"、"[UNK]"等。默认值:None,表示不添加特殊分词(token)。
|
||||
- **special_first** (list,可选) - 表示是否将 `special_tokens` 中的特殊分词添加到词典的最前面。如果为True则将 `special_tokens` 添加到词典的最前,否则添加到词典的最后。默认值:True。
|
||||
|
||||
**返回:**
|
||||
|
||||
Vocab,从文件构建的Vocab对象。
|
||||
|
||||
.. py:method:: from_list(word_list, special_tokens=None, special_first=True)
|
||||
|
||||
.. py:method:: from_list(word_list, special_tokens=None, special_first=True)
|
||||
|
||||
通过单词列表构建Vocab对象。
|
||||
从单词列表构建一个vocab对象。
|
||||
|
||||
**参数:**
|
||||
|
||||
- **word_list** (list) - 表示字符串列表,其中每个元素都是type类型的单词。
|
||||
- **special_tokens** (list,可选) - 表示字符串的列表。每个字符串都是一个特殊标记,例如special_tokens=["<pad>","<unk>"],默认值:None,表示不添加特殊标记。
|
||||
- **Special_first** (bool,可选) - 表示是否添加 `special_tokens` 到vocab。如果指定了 `special_tokens` 并将 `special_first` 设置为True,则添加 `special_tokens` ,默认值:True。
|
||||
- **word_list** (list) - 输入单词列表,每个单词需要为字符串类型。
|
||||
- **special_tokens** (list,可选) - 特殊分词列表,如常用的"[PAD]"、"[UNK]"等。默认值:None,表示不添加特殊分词(token)。
|
||||
- **special_first** (bool,可选) - 表示是否将 `special_tokens` 中的特殊分词添加到词典的最前面。如果为True则将 `special_tokens` 添加到词典的最前,否则添加到词典的最后。默认值:True。
|
||||
|
||||
**返回:**
|
||||
|
||||
Vocab,从单词列表构建的Vocab对象。
|
||||
|
||||
.. py:method:: ids_to_tokens(ids)
|
||||
|
||||
将输入索引(id)转换为对应的分词(token),支持传入单个id或一个包含多个id的列表。如果id不存在,则返回空字符串。
|
||||
|
||||
**参数:**
|
||||
|
||||
- **ids** (Union[int, list[int]]) - 要转换为分词(token)的分词(token)id(或分词(token)ids)。
|
||||
|
||||
**返回:**
|
||||
|
||||
解码的分词(token)。
|
||||
|
||||
.. py:method:: tokens_to_ids(tokens)
|
||||
|
||||
将输入分词(token)转换为对应的索引(id),支持传入单个分词或一个包含多个分词的列表。如果分词不存在,则返回-1。
|
||||
|
||||
**参数:**
|
||||
|
||||
- **tokens** (Union[str, list[str]]) - 一个或多个要转换为分词(token)id(s)的分词(token)。
|
||||
|
||||
**返回:**
|
||||
|
||||
分词(token)id或分词(token)id列表。
|
||||
|
||||
.. py:method:: vocab()
|
||||
|
||||
获取dict类型的词汇表。
|
||||
|
||||
**返回:**
|
||||
|
||||
由word和id对组成的词汇表。
|
||||
|
|
|
|||
Loading…
Reference in New Issue