.net C# stackalloc比普通变量慢?

epfja78i  于 2023-05-19  发布在  .NET
关注(0)|答案(1)|浏览(139)

我有两个函数以两种不同的方式实现uint 128乘法:一种是使用变量,另一种是使用stackalloc“数组”。

可变版本

public static UInt128 operator *(UInt128 i, UInt128 j) {

 ulong I0 = i._uint0; ulong I1 = i._uint1; ulong I2 = i._uint2; ulong I3 = i._uint3;
 ulong J0 = j._uint0; ulong J1 = j._uint1; ulong J2 = j._uint2; ulong J3 = j._uint3;
 ulong R0 = 0; ulong R1 = 0; ulong R2 = 0; ulong R3 = 0;

 if (I0 != 0) {
   R0 += I0 * J0;
   R1 += I0 * J1;
   R2 += I0 * J2;
   R3 += I0 * J3;
 }
 if (I1 != 0) {
   R1 += I1 * J0;
   R2 += I1 * J1;
   R3 += I1 * J2;
 }
 if (I2 != 0) {
   R2 += I2 * J0;
   R3 += I2 * J1;
 }
 R3 += I3 * J0;

 R1 += R0 >> 32; R0 &= uint.MaxValue;
 R2 += R1 >> 32; R1 &= uint.MaxValue;
 R3 += R2 >> 32; R2 &= uint.MaxValue;
 R3 &= uint.MaxValue;

 return new UInt128((uint)R3, (uint)R2, (uint)R1, (uint)R0);
}

Stackalloc版本

[0 + 1][1 + 1]等仅为清楚起见。它们将被C#编译器优化为常量。

public unsafe static UInt128 operator *(UInt128 i, UInt128 j) {

  var I = stackalloc ulong[4];
  var J = stackalloc ulong[4];
  var R = stackalloc ulong[4];

  I[0] = i._uint0; I[1] = i._uint1; I[2] = i._uint2; I[3] = i._uint3;
  J[0] = j._uint0; J[1] = j._uint1; J[2] = j._uint2; J[3] = j._uint3;

  if (I[0] != 0) {
    R[0] += I[0] * J[0];
    R[0 + 1] += I[0] * J[1];
    R[0 + 2] += I[0] * J[2];
    R[0 + 3] += I[0] * J[3];
  }
  if (I[1] != 0) {
    R[1] += I[1] * J[0];
    R[1 + 1] += I[1] * J[1];
    R[1 + 2] += I[1] * J[2];
  }
  if (I[2] != 0) {
    R[2] += I[2] * J[0];
    R[2 + 1] += I[2] * J[1];
  }
  R[3] += I[3] * J[0];

  R[1] += R[0] >> 32; R[0] &= uint.MaxValue;
  R[2] += R[1] >> 32; R[1] &= uint.MaxValue;
  R[3] += R[2] >> 32; R[2] &= uint.MaxValue;
  R[3] &= uint.MaxValue;

  return new UInt128((uint)R[3], (uint)R[2], (uint)R[1], (uint)R[0]);
}

由于某些原因,在x86和x64(优化)上使用.NET 4.6.1上运行的C# 7.2编译器时,“变量”版本似乎比“stackalloc”版本快20%。还没有检查过新的/旧的框架的性能,但怀疑它会是类似的,所以我的问题并不仅仅是针对4.6.1,因为它似乎是通常的情况下,stackalloc更慢。
考虑到两个版本分配完全相同的内存量(12 * sizeof(ulong)),并以相同的顺序执行完全相同的操作,是否有任何原因导致stackalloc版本较慢?我真的更喜欢通过stackalloc而不是变量来处理数组。

osh3o9ms

osh3o9ms1#

来自变量版本的IL(简化)
阵列版本中的IL(简化)
数组版本使用堆栈(参见L0009 -L004 E),但变量版本仅使用寄存器。虽然数据可以放入CPU缓存中,但它仍然比使用CPU寄存器慢。

相关问题