llmvpipe: improve mm_mullo_epi32

author José Fonseca <jfonseca@vmware.com>

Tue, 12 Oct 2010 13:15:59 +0000 (14:15 +0100)

committer Keith Whitwell <keithw@vmware.com>

Tue, 12 Oct 2010 13:17:21 +0000 (14:17 +0100)
author José Fonseca <jfonseca@vmware.com>
Tue, 12 Oct 2010 13:15:59 +0000 (14:15 +0100)
committer Keith Whitwell <keithw@vmware.com>
Tue, 12 Oct 2010 13:17:21 +0000 (14:17 +0100)
diff --git a/src/gallium/drivers/llvmpipe/lp_rast_tri.c b/src/gallium/drivers/llvmpipe/lp_rast_tri.c

index 19b0bd686a886e8bf11348a850b943ba19e5e481..c3eefb724cf0190956a9a89a3af24f5ad120b06a 100644 (file)
--- a/src/gallium/drivers/llvmpipe/lp_rast_tri.c
+++ b/src/gallium/drivers/llvmpipe/lp_rast_tri.c
@@ -321,8 +321,8 @@ transpose4_epi32(const __m128i * restrict a,
   */
  static INLINE __m128i mm_mullo_epi32(const __m128i a, const __m128i b)
  {
-   __m128i a4   = _mm_srli_si128(a, 4);  /* shift by one dword */
-   __m128i b4   = _mm_srli_si128(b, 4);  /* shift by one dword */
+   __m128i a4   = _mm_srli_epi64(a, 32);  /* shift by one dword */
+   __m128i b4   = _mm_srli_epi64(b, 32);  /* shift by one dword */
     __m128i ba   = _mm_mul_epu32(b, a);   /* multply dwords 0, 2 */
     __m128i b4a4 = _mm_mul_epu32(b4, a4); /* multiply dwords 1, 3 */
  
@@ -336,8 +336,7 @@ static INLINE __m128i mm_mullo_epi32(const __m128i a, const __m128i b)
  #else
     __m128i mask            = _mm_setr_epi32(~0,0,~0,0);
     __m128i ba_mask         = _mm_and_si128(ba, mask);
-   __m128i b4a4_mask       = _mm_and_si128(b4a4, mask);
-   __m128i b4a4_mask_shift = _mm_slli_si128(b4a4_mask, 4);
+   __m128i b4a4_mask_shift = _mm_slli_epi64(b4a4, 32);
     __m128i result          = _mm_or_si128(ba_mask, b4a4_mask_shift);
  #endif
author	José Fonseca <jfonseca@vmware.com>
	Tue, 12 Oct 2010 13:15:59 +0000 (14:15 +0100)
committer	Keith Whitwell <keithw@vmware.com>
	Tue, 12 Oct 2010 13:17:21 +0000 (14:17 +0100)