mindspore2022/docs/api/api_python/dataset/mindspore.dataset.text.tran...

23 lines
1.8 KiB
ReStructuredText
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

mindspore.dataset.text.transforms.BasicTokenizer
=================================================
.. py:class:: mindspore.dataset.text.transforms.BasicTokenizer(lower_case=False, keep_whitespace=False, normalization_form=NormalizeForm.NONE, preserve_unused_token=True, with_offsets=False)
通过特定规则标记UTF-8字符串的标量Tensor。
**注:**
Windows平台尚不支持BasicTokenizer。
**参数:**
- **lower_case** (bool可选) - 如果为True则在输入文本上应用CaseFold、 `NFD` 模式下的NormalizeUTF8、RegexReplace操作以将文本折叠到较低的用例并删除重音字符。如果为False则仅在输入文本上应用指定模式下的NormalizeUTF8操作默认为False
- **keep_whitespace** (bool可选) - 如果为True则把空白字符保留在输出标记中默认值False。
- **normalization_form** (NormalizeForm可选) - 用于指定归一化模式默认值NormalizeForm.NONE。这仅在 `lower_case` 为False时有效。可选值为NormalizeForm.NONE、NormalizeForm.NFC、NormalizeForm.NFKC、NormalizeForm.NFD和NormalizeForm.NFKD。
- NormalizeForm.NONE对输入字符串不做任何处理。
- NormalizeForm.NFC对输入字符串进行C形式规范化。
- NormalizeForm.NFKC对输入字符串进行KC形式规范化。
- NormalizeForm.NFD对输入字符串进行D形式规范化。
- NormalizeForm.NFKD对输入字符串进行KD形式规范化。
- **preserve_unused_token** (bool可选) - 如果为True则不要拆分特殊标记如'[CLS]'、'[SEP]'、'[UNK]'、'[PAD]'和'[MASK]'默认值True。
- **with_offsets** (bool可选) - 表示是否输出标记的偏移量默认值False。