SplitWithOverlap
=================

沿指定轴（axis）将输入张量切分为多个输出张量。与标准 Split 不同，该算子允许通过 `start_indices` 和 `end_indices` 自定义每个输出块的起始和结束位置，从而支持输出块之间的重叠（Overlap）。

.. math::

   \text{对于第 } j \text{ 个输出张量，其在 axis 轴上的第 } k \text{ 个元素对应：}

.. math::

   Output[j]_{(\dots, k, \dots)} = Input_{(\dots, start\_indices[j] + k, \dots)} \quad \text{其中 } 0 \le k < (end\_indices[j] - start\_indices[j])

输入：
    - **input** - 输入张量数据地址。
    - **params** - 参数数组。
        - **axis** - 进行切分的轴索引。
        - **input_shape** - 输入张量的形状数组。
        - **input_ndim** - 输入张量的维度。
        - **num_split** - 输出张量的数量。
        - **start_indices** - 每个输出张量在切分轴上的起始索引数组。
        - **end_indices** - 每个输出张量在切分轴上的结束索引数组。
    - **core_mask(int, 可选)** - 核掩码（仅适用于共享存储版本）。

输出：
    - **outputs** - 各个输出张量中填充了切分后的数据。

支持平台：
    ``FT78NE``
    ``MT7004``

.. note::
    - FT78NE 支持 int8, int16, int32, fp32, fp64, cplx64, cplx128
    - MT7004 支持 fp16, fp32, int16, int32, cplx64
    - 算子支持不连续切分或有重叠的切分。
    - 每个输出张量在非切分轴上的维度与输入张量保持一致。

**共享存储版本:**

.. c:function:: void i8_split_with_overlap_s(int8_t* input, int8_t* outputs[], long long* params, int core_mask)
.. c:function:: void i16_split_with_overlap_s(int16_t* input, int16_t* outputs[], long long* params, int core_mask)
.. c:function:: void i32_split_with_overlap_s(int32_t* input, int32_t* outputs[], long long* params, int core_mask)
.. c:function:: void hp_split_with_overlap_s(half* input, half* outputs[], long long* params, int core_mask)
.. c:function:: void fp_split_with_overlap_s(float* input, float* outputs[], long long* params, int core_mask)
.. c:function:: void dp_split_with_overlap_s(double* input, double* outputs[], long long* params, int core_mask)
.. c:function:: void c64_split_with_overlap_s(float* input, float* outputs[], long long* params, int core_mask)
.. c:function:: void c128_split_with_overlap_s(double* input, double* outputs[], long long* params, int core_mask)

    **C调用示例：**

    .. code-block:: c
        :linenos:
        :emphasize-lines: 14

        //FT78NE示例（共享存储）
        #include "78NE/utils.h"

        int main() {
            int core_id = get_core_id();
            int logic_core_id = GetLogicCoreId(core_mask, core_id);
            int core_num = GetCoreNum(core_mask);

            // --- 计算尺寸 ---
            int input_size = input_shape[0] * input_shape[1] * input_shape[2];
            int output_sizes[num_split];
            int total_output_size = 0;
            int i;
            for (i = 0; i < num_split; ++i) {
                output_sizes[i] = input_shape[0] * (end_indices[i] - start_indices[i]) * input_shape[2];
                total_output_size += output_sizes[i];
            }
            
            // --- 内存布局 (DDR空间 - 共享) ---
            float* input = (float*)0x81000000;
            float* output_base = (float*)0x82000000;
            float* check_base = (float*)0x83000000;

            // --- 构建指针数组 (栈空间 - 独享) ---
            float* outputs[num_split];
            float* check_outputs[num_split];
            int current_offset = 0;
            for (i = 0; i < num_split; ++i) {
                outputs[i] = output_base + current_offset;
                check_outputs[i] = check_base + current_offset;
                current_offset += output_sizes[i];
            }

            // --- 数据初始化 (DDR空间 - 共享) ---
            // 根据《多核编程规定》，共享空间变量的并发修改只能发生在单独分支
            if (logic_core_id == 0) {
                printf("Test_SplitWithOverlap_multicore_DDR_fp32\n");
                for (i = 0; i < input_size; ++i) {
                    input[i] = rand() / (float)RAND_MAX * 100 - 50;
                }
                // 清零输出和校验区，避免旧数据干扰
                memset(output_base, 0, total_output_size * sizeof(float));
                memset(check_base, 0, total_output_size * sizeof(float));
            }

            long long params[10];
            params[0] = (long long) axis;
            params[1] = (long long) input_shape;
            params[2] = (long long) input_ndim;
            params[3] = (long long) num_split;
            params[4] = (long long) start_indices;
            params[5] = (long long) end_indices;

            sys_bar(0, core_num);
            fp_split_with_overlap_s(input, outputs, params, core_mask);
            sys_bar(0, core_num);
            return 0;
        }


**私有存储版本:**

.. c:function:: void i8_split_with_overlap_p(int8_t* input, int8_t* outputs[], long long* params)
.. c:function:: void i16_split_with_overlap_p(int16_t* input, int16_t* outputs[], long long* params)
.. c:function:: void i32_split_with_overlap_p(int32_t* input, int32_t* outputs[], long long* params)
.. c:function:: void hp_split_with_overlap_p(half* input, half* outputs[], long long* params)
.. c:function:: void fp_split_with_overlap_p(float* input, float* outputs[], long long* params)
.. c:function:: void dp_split_with_overlap_p(double* input, double* outputs[], long long* params)
.. c:function:: void c64_split_with_overlap_p(float* input, float* outputs[], long long* params)
.. c:function:: void c128_split_with_overlap_p(double* input, double* outputs[], long long* params)

    **C调用示例：**

    .. code-block:: c
        :linenos:
        :emphasize-lines: 12

        //MT7004 示例（私有存储）
        #include <stdio.h>

        int main() {
            int input_size = input_shape[0] * input_shape[1] * input_shape[2];
            int output_sizes[num_split];
            int total_output_size = 0;
            int i;
            for (i = 0; i < num_split; ++i) {
                output_sizes[i] = input_shape[0] * (end_indices[i] - start_indices[i]) * input_shape[2];
                total_output_size += output_sizes[i];
            }
            
            int32_t* input = (int32_t*)0x10010000;
            int32_t* output_base = (int32_t*)0x10020000;
            int32_t* check_base = (int32_t*)0x10030000;

            int32_t* outputs[num_split];
            int32_t* check_outputs[num_split];
            int current_offset = 0;
            for (i = 0; i < num_split; ++i) {
                outputs[i] = output_base + current_offset;
                check_outputs[i] = check_base + current_offset;
                current_offset += output_sizes[i];
            }

            for (i = 0; i < input_size; ++i) {
                input[i] = (int32_t)i + 0.1f;
            }
            memset(output_base, 0, total_output_size * sizeof(int32_t));
            memset(check_base, 0, total_output_size * sizeof(int32_t));

            long long params[10];
            params[0] = (long long)axis;
            params[1] = (long long)input_shape;
            params[2] = input_ndim;
            params[3] = num_split;
            params[4] = (long long)start_indices;
            params[5] = (long long)end_indices;

            i32_split_with_overlap_p(input, outputs, params);
            return 0;
        }