add minddata api cn

This commit is contained in:
yingchen 2021-11-17 18:58:35 +08:00
parent 617485fa0b
commit e24def4c52
6 changed files with 181 additions and 0 deletions

View File

@ -0,0 +1,37 @@
mindspore.dataset.DatasetCache
==============================
.. py:class:: mindspore.dataset.DatasetCache(session_id, size=0, spilling=False, hostname=None, port=None, num_connections=None, prefetch_size=None)
创建数据缓存客户端实例。
有关详细信息,请查看 `教程 <https://www.mindspore.cn/docs/programming_guide/zh-CN/master/enable_cache.html>`_
`编程指南 <https://www.mindspore.cn/docs/programming_guide/zh-CN/master/cache.html>`_
**参数:**
- **session_id** (int)当前数据缓存客户端的会话ID用户在命令行开启缓存服务端后可通过 `cache_admin -g` 获取。
- **size** (int, optional)设置数据缓存服务可用的内存大小默认为0即内存使用没有上限。注意这可能会产生计算机内存不足的风险
- **spilling** (bool, optional)如果共享内存不足是否将溢出部分缓存到磁盘默认为False
- **hostname** (str, optional)数据缓存服务客户端的主机IP默认为None使用默认主机名127.0.0.1)。
- **port** (int, optional)指定连接到数据缓存服务端的端口号默认为None使用端口50052
- **num_connections** (int, optional)TCP/IP连接数量默认为None使用默认值12
- **prefetch_size** (int, optional)指定缓存队列大小使用缓存功能算子时将直接从缓存队列中获取数据默认为None使用默认值20
**样例:**
.. code-block::
>>> import mindspore.dataset as ds
>>>
>>> # 创建数据缓存客户端实例,其中 `session_id` 由命令 `cache_admin -g` 生成
>>> some_cache = ds.DatasetCache(session_id=session_id, size=0)
>>>
>>> dataset_dir = "path/to/imagefolder_directory"
>>> ds1 = ds.ImageFolderDataset(dataset_dir, cache=some_cache)
.. py:method:: get_stat()
获取缓存实例的统计信息。

View File

@ -0,0 +1,24 @@
mindspore.dataset.compare
==========================
.. py:method:: mindspore.dataset.compare(pipeline1, pipeline2)
比较两个数据处理管道是否相同。
**参数:**
- **pipeline1** (Dataset):数据处理管道。
- **pipeline2** (Dataset):数据处理管道。
**返回:**
bool两个数据处理管道是否相等。
**样例:**
.. code-block::
>>> pipeline1 = ds.MnistDataset(mnist_dataset_dir, 100)
>>> pipeline2 = ds.Cifar10Dataset(cifar_dataset_dir, 100)
>>> ds.compare(pipeline1, pipeline2)

View File

@ -0,0 +1,39 @@
mindspore.dataset.deserialize
==============================
.. py:method:: mindspore.dataset.deserialize(input_dict=None, json_filepath=None)
数据处理管道反序列化支持输入Python字典或使用 `mindspore.dataset.serialize()` 接口生成的JSON文件。
.. note::
反序列化包含自定义Python函数的数据处理管道时部分参数信息可能丢失`input_dict``json_filepath` 同时不为None时返回反序列化JSON文件的结果。
**参数:**
- **input_dict** (dict)包含序列化数据集图的Python字典。
- **json_filepath** (str)JSON文件的路径用户可通过 `mindspore.dataset.serialize()` 接口生成。
**返回:**
成功时返回Dataset对象失败时则返回None。
**异常:**
**OSError:** 无法打开JSON文件。
**样例:**
.. code-block::
>>> dataset = ds.MnistDataset(mnist_dataset_dir, 100)
>>> one_hot_encode = c_transforms.OneHot(10) # num_classes是输入参数
>>> dataset = dataset.map(operation=one_hot_encode, input_column_names="label")
>>> dataset = dataset.batch(batch_size=10, drop_remainder=True)
>>> # 用例1序列化/反序列化 JSON文件
>>> ds.engine.serialize(dataset, json_filepath="/path/to/mnist_dataset_pipeline.json")
>>> dataset = ds.engine.deserialize(json_filepath="/path/to/mnist_dataset_pipeline.json")
>>> # 用例2序列化/反序列化 Python字典
>>> serialized_data = ds.engine.serialize(dataset)
>>> dataset = ds.engine.deserialize(input_dict=serialized_data)

View File

@ -0,0 +1,35 @@
mindspore.dataset.serialize
============================
.. py:method:: mindspore.dataset.serialize(dataset, json_filepath='')
将数据处理管道序列化成JSON文件。
.. note::
目前不支持某些Python对象序列化。对于map算子的自定义Python函数序列化 `mindspore.dataset.serialize` 仅返回其函数名称。
**参数:**
- **dataset** (Dataset): 数据处理管道对象。
- **json_filepath** (str): 生成序列化JSON文件的路径。
**返回:**
Dict包含序列化数据集图的字典。
**异常:**
**OSError:** 无法打开文件。
**样例:**
.. code-block::
>>> dataset = ds.MnistDataset(mnist_dataset_dir, 100)
>>> one_hot_encode = c_transforms.OneHot(10) # num_classes是输入参数
>>> dataset = dataset.map(operation=one_hot_encode, input_column_names="label")
>>> dataset = dataset.batch(batch_size=10, drop_remainder=True)
>>> # 将其序列化为JSON文件
>>> ds.engine.serialize(dataset, json_filepath="/path/to/mnist_dataset_pipeline.json")
>>> serialized_data = ds.engine.serialize(dataset) # 将其序列化为Python字典

View File

@ -0,0 +1,22 @@
mindspore.dataset.show
======================
.. py:method:: mindspore.dataset.show(dataset, indentation=2)
将数据处理管道图写入MindSpore的INFO级别日志文件。
**参数:**
- **dataset** (Dataset): 数据处理管道对象。
- **indentation** (int, optional): 设置MindSpore的INFO级别日志文件打印时的缩进字符数。若为None则不缩进。
**样例:**
.. code-block::
>>> dataset = ds.MnistDataset(mnist_dataset_dir, 100)
>>> one_hot_encode = c_transforms.OneHot(10)
>>> dataset = dataset.map(operation=one_hot_encode, input_column_names="label")
>>> dataset = dataset.batch(batch_size=10, drop_remainder=True)
>>> ds.show(dataset)

View File

@ -0,0 +1,24 @@
mindspore.dataset.audio.transforms.AllpassBiquad
=================================================
.. py:class:: mindspore.dataset.audio.transforms.AllpassBiquad(sample_rate, central_freq, Q=0.707)
给形如(..., time)维度的音频波形施加双极点全通滤波器。
**参数:**
- **sample_rate** (int)采样率例如44100 (Hz),不能为零。
- **central_freq** (float)中心频率单位Hz
- **Q** (float, optional):品质因子,参考 https://en.wikipedia.org/wiki/Q_factor取值范围(0, 1]默认值为0.707)。
**样例:**
.. code-block::
>>> import numpy as np
>>>
>>> waveform = np.array([[2.716064453125e-03, 6.34765625e-03], [9.246826171875e-03, 1.0894775390625e-02]])
>>> numpy_slices_dataset = ds.NumpySlicesDataset(data=waveform, column_names=["audio"])
>>> transforms = [audio.AllpassBiquad(44100, 200.0)]
>>> numpy_slices_dataset = numpy_slices_dataset.map(operations=transforms, input_columns=["audio"])