[CORE] Fixed VEX/NonVEX performance penalty inside Convert evalute impl (#15355)
This commit is contained in:
parent
3c8ec29423
commit
5770daf303
|
|
@ -28,7 +28,7 @@ void jit_convert_vec<uint8_t, float16>(jit::Generator& gen, const Xbyak::RegExp&
|
|||
gen.vcvtdq2ps(fvec, i32vec);
|
||||
gen.vcvtps2ph(f16vec, fvec, 0);
|
||||
gen.vzeroupper();
|
||||
gen.movdqu(gen.xword[dst], f16vec);
|
||||
gen.vmovdqu(gen.xword[dst], f16vec);
|
||||
}
|
||||
|
||||
template <>
|
||||
|
|
@ -36,7 +36,7 @@ void jit_convert_vec<float16, float>(jit::Generator& gen, const Xbyak::RegExp& s
|
|||
auto f16vec = gen.xmm3;
|
||||
auto f32vec = gen.ymm4;
|
||||
|
||||
gen.movdqu(f16vec, gen.xword[src]);
|
||||
gen.vmovdqu(f16vec, gen.xword[src]);
|
||||
gen.vcvtph2ps(f32vec, f16vec);
|
||||
gen.vmovups(gen.yword[dst], f32vec);
|
||||
}
|
||||
|
|
|
|||
Loading…
Reference in New Issue