shithub: libvpx

--- a/vp8/common/arm/neon/vp8_subpixelvariance16x16_neon.asm

+++ /dev/null

@@ -1,425 +1,0 @@

-;

-;  Copyright (c) 2010 The WebM project authors. All Rights Reserved.

-;

-;  Use of this source code is governed by a BSD-style license

-;  that can be found in the LICENSE file in the root of the source

-;  tree. An additional intellectual property rights grant can be found

-;  in the file PATENTS.  All contributing project authors may

-;  be found in the AUTHORS file in the root of the source tree.

-;

-;-----------------

-    EXPORT  |vp8_sub_pixel_variance16x16_neon_func|

-    ARM

-    REQUIRE8

-    PRESERVE8

-    AREA ||.text||, CODE, READONLY, ALIGN=2

-; r0    unsigned char  *src_ptr,

-; r1    int  src_pixels_per_line,

-; r2    int  xoffset,

-; r3    int  yoffset,

-; stack(r4) unsigned char *dst_ptr,

-; stack(r5) int dst_pixels_per_line,

-; stack(r6) unsigned int *sse

-;note: most of the code is copied from bilinear_predict16x16_neon and vp8_variance16x16_neon.

-bilinear_taps_coeff

-    DCD     128, 0, 112, 16, 96, 32, 80, 48, 64, 64, 48, 80, 32, 96, 16, 112

-|vp8_sub_pixel_variance16x16_neon_func| PROC

-    push            {r4-r6, lr}

-    vpush           {d8-d15}

-    adr             r12, bilinear_taps_coeff

-    ldr             r4, [sp, #80]           ;load *dst_ptr from stack

-    ldr             r5, [sp, #84]           ;load dst_pixels_per_line from stack

-    ldr             r6, [sp, #88]           ;load *sse from stack

-    cmp             r2, #0                  ;skip first_pass filter if xoffset=0

-    beq             secondpass_bfilter16x16_only

-    add             r2, r12, r2, lsl #3     ;calculate filter location

-    cmp             r3, #0                  ;skip second_pass filter if yoffset=0

-    vld1.s32        {d31}, [r2]             ;load first_pass filter

-    beq             firstpass_bfilter16x16_only

-    sub             sp, sp, #272            ;reserve space on stack for temporary storage

-    vld1.u8         {d2, d3, d4}, [r0], r1      ;load src data

-    mov             lr, sp

-    vld1.u8         {d5, d6, d7}, [r0], r1

-    mov             r2, #3                  ;loop counter

-    vld1.u8         {d8, d9, d10}, [r0], r1

-    vdup.8          d0, d31[0]              ;first_pass filter (d0 d1)

-    vld1.u8         {d11, d12, d13}, [r0], r1

-    vdup.8          d1, d31[4]

-;First Pass: output_height lines x output_width columns (17x16)

-vp8e_filt_blk2d_fp16x16_loop_neon

-    pld             [r0]

-    pld             [r0, r1]

-    pld             [r0, r1, lsl #1]

-    vmull.u8        q7, d2, d0              ;(src_ptr[0] * Filter[0])

-    vmull.u8        q8, d3, d0

-    vmull.u8        q9, d5, d0

-    vmull.u8        q10, d6, d0

-    vmull.u8        q11, d8, d0

-    vmull.u8        q12, d9, d0

-    vmull.u8        q13, d11, d0

-    vmull.u8        q14, d12, d0

-    vext.8          d2, d2, d3, #1          ;construct src_ptr[1]

-    vext.8          d5, d5, d6, #1

-    vext.8          d8, d8, d9, #1

-    vext.8          d11, d11, d12, #1

-    vmlal.u8        q7, d2, d1              ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q9, d5, d1

-    vmlal.u8        q11, d8, d1

-    vmlal.u8        q13, d11, d1

-    vext.8          d3, d3, d4, #1

-    vext.8          d6, d6, d7, #1

-    vext.8          d9, d9, d10, #1

-    vext.8          d12, d12, d13, #1

-    vmlal.u8        q8, d3, d1              ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q10, d6, d1

-    vmlal.u8        q12, d9, d1

-    vmlal.u8        q14, d12, d1

-    subs            r2, r2, #1

-    vqrshrn.u16    d14, q7, #7              ;shift/round/saturate to u8

-    vqrshrn.u16    d15, q8, #7

-    vqrshrn.u16    d16, q9, #7

-    vqrshrn.u16    d17, q10, #7

-    vqrshrn.u16    d18, q11, #7

-    vqrshrn.u16    d19, q12, #7

-    vqrshrn.u16    d20, q13, #7

-    vld1.u8         {d2, d3, d4}, [r0], r1      ;load src data

-    vqrshrn.u16    d21, q14, #7

-    vld1.u8         {d5, d6, d7}, [r0], r1

-    vst1.u8         {d14, d15, d16, d17}, [lr]!     ;store result

-    vld1.u8         {d8, d9, d10}, [r0], r1

-    vst1.u8         {d18, d19, d20, d21}, [lr]!

-    vld1.u8         {d11, d12, d13}, [r0], r1

-    bne             vp8e_filt_blk2d_fp16x16_loop_neon

-;First-pass filtering for rest 5 lines

-    vld1.u8         {d14, d15, d16}, [r0], r1

-    vmull.u8        q9, d2, d0              ;(src_ptr[0] * Filter[0])

-    vmull.u8        q10, d3, d0

-    vmull.u8        q11, d5, d0

-    vmull.u8        q12, d6, d0

-    vmull.u8        q13, d8, d0

-    vmull.u8        q14, d9, d0

-    vext.8          d2, d2, d3, #1          ;construct src_ptr[1]

-    vext.8          d5, d5, d6, #1

-    vext.8          d8, d8, d9, #1

-    vmlal.u8        q9, d2, d1              ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q11, d5, d1

-    vmlal.u8        q13, d8, d1

-    vext.8          d3, d3, d4, #1

-    vext.8          d6, d6, d7, #1

-    vext.8          d9, d9, d10, #1

-    vmlal.u8        q10, d3, d1             ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q12, d6, d1

-    vmlal.u8        q14, d9, d1

-    vmull.u8        q1, d11, d0

-    vmull.u8        q2, d12, d0

-    vmull.u8        q3, d14, d0

-    vmull.u8        q4, d15, d0

-    vext.8          d11, d11, d12, #1       ;construct src_ptr[1]

-    vext.8          d14, d14, d15, #1

-    vmlal.u8        q1, d11, d1             ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q3, d14, d1

-    vext.8          d12, d12, d13, #1

-    vext.8          d15, d15, d16, #1

-    vmlal.u8        q2, d12, d1             ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q4, d15, d1

-    vqrshrn.u16    d10, q9, #7              ;shift/round/saturate to u8

-    vqrshrn.u16    d11, q10, #7

-    vqrshrn.u16    d12, q11, #7

-    vqrshrn.u16    d13, q12, #7

-    vqrshrn.u16    d14, q13, #7

-    vqrshrn.u16    d15, q14, #7

-    vqrshrn.u16    d16, q1, #7

-    vqrshrn.u16    d17, q2, #7

-    vqrshrn.u16    d18, q3, #7

-    vqrshrn.u16    d19, q4, #7

-    vst1.u8         {d10, d11, d12, d13}, [lr]!         ;store result

-    vst1.u8         {d14, d15, d16, d17}, [lr]!

-    vst1.u8         {d18, d19}, [lr]!

-;Second pass: 16x16

-;secondpass_filter

-    add             r3, r12, r3, lsl #3

-    sub             lr, lr, #272

-    vld1.u32        {d31}, [r3]             ;load second_pass filter

-    sub             sp, sp, #256

-    mov             r3, sp

-    vld1.u8         {d22, d23}, [lr]!       ;load src data

-    vdup.8          d0, d31[0]              ;second_pass filter parameters (d0 d1)

-    vdup.8          d1, d31[4]

-    mov             r12, #4                 ;loop counter

-vp8e_filt_blk2d_sp16x16_loop_neon

-    vld1.u8         {d24, d25}, [lr]!

-    vmull.u8        q1, d22, d0             ;(src_ptr[0] * Filter[0])

-    vld1.u8         {d26, d27}, [lr]!

-    vmull.u8        q2, d23, d0

-    vld1.u8         {d28, d29}, [lr]!

-    vmull.u8        q3, d24, d0

-    vld1.u8         {d30, d31}, [lr]!

-    vmull.u8        q4, d25, d0

-    vmull.u8        q5, d26, d0

-    vmull.u8        q6, d27, d0

-    vmull.u8        q7, d28, d0

-    vmull.u8        q8, d29, d0

-    vmlal.u8        q1, d24, d1             ;(src_ptr[pixel_step] * Filter[1])

-    vmlal.u8        q2, d25, d1

-    vmlal.u8        q3, d26, d1

-    vmlal.u8        q4, d27, d1

-    vmlal.u8        q5, d28, d1

-    vmlal.u8        q6, d29, d1

-    vmlal.u8        q7, d30, d1

-    vmlal.u8        q8, d31, d1

-    subs            r12, r12, #1

-    vqrshrn.u16    d2, q1, #7               ;shift/round/saturate to u8

-    vqrshrn.u16    d3, q2, #7

-    vqrshrn.u16    d4, q3, #7

-    vqrshrn.u16    d5, q4, #7

-    vqrshrn.u16    d6, q5, #7

-    vqrshrn.u16    d7, q6, #7

-    vqrshrn.u16    d8, q7, #7

-    vqrshrn.u16    d9, q8, #7

-    vst1.u8         {d2, d3}, [r3]!         ;store result

-    vst1.u8         {d4, d5}, [r3]!

-    vst1.u8         {d6, d7}, [r3]!

-    vmov            q11, q15

-    vst1.u8         {d8, d9}, [r3]!

-    bne             vp8e_filt_blk2d_sp16x16_loop_neon

-    b               sub_pixel_variance16x16_neon

-;--------------------

-firstpass_bfilter16x16_only

-    mov             r2, #4                      ;loop counter

-    sub             sp, sp, #528            ;reserve space on stack for temporary storage

-    vdup.8          d0, d31[0]                  ;first_pass filter (d0 d1)

-    vdup.8          d1, d31[4]

-    mov             r3, sp

-;First Pass: output_height lines x output_width columns (16x16)

-vp8e_filt_blk2d_fpo16x16_loop_neon

-    vld1.u8         {d2, d3, d4}, [r0], r1      ;load src data

-    vld1.u8         {d5, d6, d7}, [r0], r1

-    vld1.u8         {d8, d9, d10}, [r0], r1

-    vld1.u8         {d11, d12, d13}, [r0], r1

-    pld             [r0]

-    pld             [r0, r1]

-    pld             [r0, r1, lsl #1]

-    vmull.u8        q7, d2, d0              ;(src_ptr[0] * Filter[0])

-    vmull.u8        q8, d3, d0

-    vmull.u8        q9, d5, d0

-    vmull.u8        q10, d6, d0

-    vmull.u8        q11, d8, d0

-    vmull.u8        q12, d9, d0

-    vmull.u8        q13, d11, d0

-    vmull.u8        q14, d12, d0

-    vext.8          d2, d2, d3, #1          ;construct src_ptr[1]

-    vext.8          d5, d5, d6, #1

-    vext.8          d8, d8, d9, #1

-    vext.8          d11, d11, d12, #1

-    vmlal.u8        q7, d2, d1              ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q9, d5, d1

-    vmlal.u8        q11, d8, d1

-    vmlal.u8        q13, d11, d1

-    vext.8          d3, d3, d4, #1

-    vext.8          d6, d6, d7, #1

-    vext.8          d9, d9, d10, #1

-    vext.8          d12, d12, d13, #1

-    vmlal.u8        q8, d3, d1              ;(src_ptr[0] * Filter[1])

-    vmlal.u8        q10, d6, d1

-    vmlal.u8        q12, d9, d1

-    vmlal.u8        q14, d12, d1

-    subs            r2, r2, #1

-    vqrshrn.u16    d14, q7, #7              ;shift/round/saturate to u8

-    vqrshrn.u16    d15, q8, #7

-    vqrshrn.u16    d16, q9, #7

-    vqrshrn.u16    d17, q10, #7

-    vqrshrn.u16    d18, q11, #7

-    vqrshrn.u16    d19, q12, #7

-    vqrshrn.u16    d20, q13, #7

-    vst1.u8         {d14, d15}, [r3]!       ;store result

-    vqrshrn.u16    d21, q14, #7

-    vst1.u8         {d16, d17}, [r3]!

-    vst1.u8         {d18, d19}, [r3]!

-    vst1.u8         {d20, d21}, [r3]!

-    bne             vp8e_filt_blk2d_fpo16x16_loop_neon

-    b               sub_pixel_variance16x16_neon

-;---------------------

-secondpass_bfilter16x16_only

-;Second pass: 16x16

-;secondpass_filter

-    sub             sp, sp, #528            ;reserve space on stack for temporary storage

-    add             r3, r12, r3, lsl #3

-    mov             r12, #4                     ;loop counter

-    vld1.u32        {d31}, [r3]                 ;load second_pass filter

-    vld1.u8         {d22, d23}, [r0], r1        ;load src data

-    mov             r3, sp

-    vdup.8          d0, d31[0]                  ;second_pass filter parameters (d0 d1)

-    vdup.8          d1, d31[4]

-vp8e_filt_blk2d_spo16x16_loop_neon

-    vld1.u8         {d24, d25}, [r0], r1

-    vmull.u8        q1, d22, d0             ;(src_ptr[0] * Filter[0])

-    vld1.u8         {d26, d27}, [r0], r1

-    vmull.u8        q2, d23, d0

-    vld1.u8         {d28, d29}, [r0], r1

-    vmull.u8        q3, d24, d0

-    vld1.u8         {d30, d31}, [r0], r1

-    vmull.u8        q4, d25, d0

-    vmull.u8        q5, d26, d0

-    vmull.u8        q6, d27, d0

-    vmull.u8        q7, d28, d0

-    vmull.u8        q8, d29, d0

-    vmlal.u8        q1, d24, d1             ;(src_ptr[pixel_step] * Filter[1])

-    vmlal.u8        q2, d25, d1

-    vmlal.u8        q3, d26, d1

-    vmlal.u8        q4, d27, d1

-    vmlal.u8        q5, d28, d1

-    vmlal.u8        q6, d29, d1

-    vmlal.u8        q7, d30, d1

-    vmlal.u8        q8, d31, d1

-    vqrshrn.u16    d2, q1, #7               ;shift/round/saturate to u8

-    vqrshrn.u16    d3, q2, #7

-    vqrshrn.u16    d4, q3, #7

-    vqrshrn.u16    d5, q4, #7

-    vqrshrn.u16    d6, q5, #7

-    vqrshrn.u16    d7, q6, #7

-    vqrshrn.u16    d8, q7, #7

-    vqrshrn.u16    d9, q8, #7

-    vst1.u8         {d2, d3}, [r3]!         ;store result

-    subs            r12, r12, #1

-    vst1.u8         {d4, d5}, [r3]!

-    vmov            q11, q15

-    vst1.u8         {d6, d7}, [r3]!

-    vst1.u8         {d8, d9}, [r3]!

-    bne             vp8e_filt_blk2d_spo16x16_loop_neon

-    b               sub_pixel_variance16x16_neon

-;----------------------------

-;variance16x16

-sub_pixel_variance16x16_neon

-    vmov.i8         q8, #0                      ;q8 - sum

-    vmov.i8         q9, #0                      ;q9, q10 - sse

-    vmov.i8         q10, #0

-    sub             r3, r3, #256

-    mov             r12, #8

-sub_pixel_variance16x16_neon_loop

-    vld1.8          {q0}, [r3]!                 ;Load up source and reference

-    vld1.8          {q2}, [r4], r5

-    vld1.8          {q1}, [r3]!

-    vld1.8          {q3}, [r4], r5

-    vsubl.u8        q11, d0, d4                 ;diff

-    vsubl.u8        q12, d1, d5

-    vsubl.u8        q13, d2, d6

-    vsubl.u8        q14, d3, d7

-    vpadal.s16      q8, q11                     ;sum

-    vmlal.s16       q9, d22, d22                ;sse

-    vmlal.s16       q10, d23, d23

-    subs            r12, r12, #1

-    vpadal.s16      q8, q12

-    vmlal.s16       q9, d24, d24

-    vmlal.s16       q10, d25, d25

-    vpadal.s16      q8, q13

-    vmlal.s16       q9, d26, d26

-    vmlal.s16       q10, d27, d27

-    vpadal.s16      q8, q14

-    vmlal.s16       q9, d28, d28

-    vmlal.s16       q10, d29, d29

-    bne             sub_pixel_variance16x16_neon_loop

-    vadd.u32        q10, q9, q10                ;accumulate sse

-    vpaddl.s32      q0, q8                      ;accumulate sum

-    vpaddl.u32      q1, q10

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [r6]               ;store sse

-    vshr.u32        d10, d10, #8

-    vsub.u32        d0, d1, d10

-    add             sp, sp, #528

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {r4-r6,pc}

-    ENDP

-    END

--- a/vp8/common/arm/neon/vp8_subpixelvariance16x16s_neon.asm

+++ /dev/null

@@ -1,583 +1,0 @@

-;

-;  Copyright (c) 2010 The WebM project authors. All Rights Reserved.

-;

-;  Use of this source code is governed by a BSD-style license

-;  that can be found in the LICENSE file in the root of the source

-;  tree. An additional intellectual property rights grant can be found

-;  in the file PATENTS.  All contributing project authors may

-;  be found in the AUTHORS file in the root of the source tree.

-;

-    EXPORT  |vp8_variance_halfpixvar16x16_h_neon|

-    EXPORT  |vp8_variance_halfpixvar16x16_v_neon|

-    EXPORT  |vp8_variance_halfpixvar16x16_hv_neon|

-    EXPORT  |vp8_sub_pixel_variance16x16s_neon|

-    ARM

-    REQUIRE8

-    PRESERVE8

-    AREA ||.text||, CODE, READONLY, ALIGN=2

-;================================================

-;unsigned int vp8_variance_halfpixvar16x16_h_neon

-;(

-;    unsigned char  *src_ptr, r0

-;    int  src_pixels_per_line,  r1

-;    unsigned char *dst_ptr,  r2

-;    int dst_pixels_per_line,   r3

-;    unsigned int *sse

-;);

-;================================================

-|vp8_variance_halfpixvar16x16_h_neon| PROC

-    push            {lr}

-    vpush           {d8-d15}

-    mov             r12, #4                  ;loop counter

-    ldr             lr, [sp, #68]            ;load *sse from stack

-    vmov.i8         q8, #0                      ;q8 - sum

-    vmov.i8         q9, #0                      ;q9, q10 - sse

-    vmov.i8         q10, #0

-;First Pass: output_height lines x output_width columns (16x16)

-vp8_filt_fpo16x16s_4_0_loop_neon

-    vld1.u8         {d0, d1, d2, d3}, [r0], r1      ;load src data

-    vld1.8          {q11}, [r2], r3

-    vld1.u8         {d4, d5, d6, d7}, [r0], r1

-    vld1.8          {q12}, [r2], r3

-    vld1.u8         {d8, d9, d10, d11}, [r0], r1

-    vld1.8          {q13}, [r2], r3

-    vld1.u8         {d12, d13, d14, d15}, [r0], r1

-    ;pld                [r0]

-    ;pld                [r0, r1]

-    ;pld                [r0, r1, lsl #1]

-    vext.8          q1, q0, q1, #1          ;construct src_ptr[1]

-    vext.8          q3, q2, q3, #1

-    vext.8          q5, q4, q5, #1

-    vext.8          q7, q6, q7, #1

-    vrhadd.u8       q0, q0, q1              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-    vld1.8          {q14}, [r2], r3

-    vrhadd.u8       q1, q2, q3

-    vrhadd.u8       q2, q4, q5

-    vrhadd.u8       q3, q6, q7

-    vsubl.u8        q4, d0, d22                 ;diff

-    vsubl.u8        q5, d1, d23

-    vsubl.u8        q6, d2, d24

-    vsubl.u8        q7, d3, d25

-    vsubl.u8        q0, d4, d26

-    vsubl.u8        q1, d5, d27

-    vsubl.u8        q2, d6, d28

-    vsubl.u8        q3, d7, d29

-    vpadal.s16      q8, q4                     ;sum

-    vmlal.s16       q9, d8, d8                ;sse

-    vmlal.s16       q10, d9, d9

-    subs            r12, r12, #1

-    vpadal.s16      q8, q5

-    vmlal.s16       q9, d10, d10

-    vmlal.s16       q10, d11, d11

-    vpadal.s16      q8, q6

-    vmlal.s16       q9, d12, d12

-    vmlal.s16       q10, d13, d13

-    vpadal.s16      q8, q7

-    vmlal.s16       q9, d14, d14

-    vmlal.s16       q10, d15, d15

-    vpadal.s16      q8, q0                     ;sum

-    vmlal.s16       q9, d0, d0                ;sse

-    vmlal.s16       q10, d1, d1

-    vpadal.s16      q8, q1

-    vmlal.s16       q9, d2, d2

-    vmlal.s16       q10, d3, d3

-    vpadal.s16      q8, q2

-    vmlal.s16       q9, d4, d4

-    vmlal.s16       q10, d5, d5

-    vpadal.s16      q8, q3

-    vmlal.s16       q9, d6, d6

-    vmlal.s16       q10, d7, d7

-    bne             vp8_filt_fpo16x16s_4_0_loop_neon

-    vadd.u32        q10, q9, q10                ;accumulate sse

-    vpaddl.s32      q0, q8                      ;accumulate sum

-    vpaddl.u32      q1, q10

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [lr]               ;store sse

-    vshr.u32        d10, d10, #8

-    vsub.u32        d0, d1, d10

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {pc}

-    ENDP

-;================================================

-;unsigned int vp8_variance_halfpixvar16x16_v_neon

-;(

-;    unsigned char  *src_ptr, r0

-;    int  src_pixels_per_line,  r1

-;    unsigned char *dst_ptr,  r2

-;    int dst_pixels_per_line,   r3

-;    unsigned int *sse

-;);

-;================================================

-|vp8_variance_halfpixvar16x16_v_neon| PROC

-    push            {lr}

-    vpush           {d8-d15}

-    mov             r12, #4                     ;loop counter

-    vld1.u8         {q0}, [r0], r1              ;load src data

-    ldr             lr, [sp, #68]               ;load *sse from stack

-    vmov.i8         q8, #0                      ;q8 - sum

-    vmov.i8         q9, #0                      ;q9, q10 - sse

-    vmov.i8         q10, #0

-vp8_filt_spo16x16s_0_4_loop_neon

-    vld1.u8         {q2}, [r0], r1

-    vld1.8          {q1}, [r2], r3

-    vld1.u8         {q4}, [r0], r1

-    vld1.8          {q3}, [r2], r3

-    vld1.u8         {q6}, [r0], r1

-    vld1.8          {q5}, [r2], r3

-    vld1.u8         {q15}, [r0], r1

-    vrhadd.u8       q0, q0, q2

-    vld1.8          {q7}, [r2], r3

-    vrhadd.u8       q2, q2, q4

-    vrhadd.u8       q4, q4, q6

-    vrhadd.u8       q6, q6, q15

-    vsubl.u8        q11, d0, d2                 ;diff

-    vsubl.u8        q12, d1, d3

-    vsubl.u8        q13, d4, d6

-    vsubl.u8        q14, d5, d7

-    vsubl.u8        q0, d8, d10

-    vsubl.u8        q1, d9, d11

-    vsubl.u8        q2, d12, d14

-    vsubl.u8        q3, d13, d15

-    vpadal.s16      q8, q11                     ;sum

-    vmlal.s16       q9, d22, d22                ;sse

-    vmlal.s16       q10, d23, d23

-    subs            r12, r12, #1

-    vpadal.s16      q8, q12

-    vmlal.s16       q9, d24, d24

-    vmlal.s16       q10, d25, d25

-    vpadal.s16      q8, q13

-    vmlal.s16       q9, d26, d26

-    vmlal.s16       q10, d27, d27

-    vpadal.s16      q8, q14

-    vmlal.s16       q9, d28, d28

-    vmlal.s16       q10, d29, d29

-    vpadal.s16      q8, q0                     ;sum

-    vmlal.s16       q9, d0, d0                 ;sse

-    vmlal.s16       q10, d1, d1

-    vpadal.s16      q8, q1

-    vmlal.s16       q9, d2, d2

-    vmlal.s16       q10, d3, d3

-    vpadal.s16      q8, q2

-    vmlal.s16       q9, d4, d4

-    vmlal.s16       q10, d5, d5

-    vmov            q0, q15

-    vpadal.s16      q8, q3

-    vmlal.s16       q9, d6, d6

-    vmlal.s16       q10, d7, d7

-    bne             vp8_filt_spo16x16s_0_4_loop_neon

-    vadd.u32        q10, q9, q10                ;accumulate sse

-    vpaddl.s32      q0, q8                      ;accumulate sum

-    vpaddl.u32      q1, q10

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [lr]               ;store sse

-    vshr.u32        d10, d10, #8

-    vsub.u32        d0, d1, d10

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {pc}

-    ENDP

-;================================================

-;unsigned int vp8_variance_halfpixvar16x16_hv_neon

-;(

-;    unsigned char  *src_ptr, r0

-;    int  src_pixels_per_line,  r1

-;    unsigned char *dst_ptr,  r2

-;    int dst_pixels_per_line,   r3

-;    unsigned int *sse

-;);

-;================================================

-|vp8_variance_halfpixvar16x16_hv_neon| PROC

-    push            {lr}

-    vpush           {d8-d15}

-    vld1.u8         {d0, d1, d2, d3}, [r0], r1      ;load src data

-    ldr             lr, [sp, #68]           ;load *sse from stack

-    vmov.i8         q13, #0                      ;q8 - sum

-    vext.8          q1, q0, q1, #1          ;construct src_ptr[1]

-    vmov.i8         q14, #0                      ;q9, q10 - sse

-    vmov.i8         q15, #0

-    mov             r12, #4                  ;loop counter

-    vrhadd.u8       q0, q0, q1              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-;First Pass: output_height lines x output_width columns (17x16)

-vp8_filt16x16s_4_4_loop_neon

-    vld1.u8         {d4, d5, d6, d7}, [r0], r1

-    vld1.u8         {d8, d9, d10, d11}, [r0], r1

-    vld1.u8         {d12, d13, d14, d15}, [r0], r1

-    vld1.u8         {d16, d17, d18, d19}, [r0], r1

-    ;pld                [r0]

-    ;pld                [r0, r1]

-    ;pld                [r0, r1, lsl #1]

-    vext.8          q3, q2, q3, #1          ;construct src_ptr[1]

-    vext.8          q5, q4, q5, #1

-    vext.8          q7, q6, q7, #1

-    vext.8          q9, q8, q9, #1

-    vrhadd.u8       q1, q2, q3              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-    vrhadd.u8       q2, q4, q5

-    vrhadd.u8       q3, q6, q7

-    vrhadd.u8       q4, q8, q9

-    vld1.8          {q5}, [r2], r3

-    vrhadd.u8       q0, q0, q1

-    vld1.8          {q6}, [r2], r3

-    vrhadd.u8       q1, q1, q2

-    vld1.8          {q7}, [r2], r3

-    vrhadd.u8       q2, q2, q3

-    vld1.8          {q8}, [r2], r3

-    vrhadd.u8       q3, q3, q4

-    vsubl.u8        q9, d0, d10                 ;diff

-    vsubl.u8        q10, d1, d11

-    vsubl.u8        q11, d2, d12

-    vsubl.u8        q12, d3, d13

-    vsubl.u8        q0, d4, d14                 ;diff

-    vsubl.u8        q1, d5, d15

-    vsubl.u8        q5, d6, d16

-    vsubl.u8        q6, d7, d17

-    vpadal.s16      q13, q9                     ;sum

-    vmlal.s16       q14, d18, d18                ;sse

-    vmlal.s16       q15, d19, d19

-    vpadal.s16      q13, q10                     ;sum

-    vmlal.s16       q14, d20, d20                ;sse

-    vmlal.s16       q15, d21, d21

-    vpadal.s16      q13, q11                     ;sum

-    vmlal.s16       q14, d22, d22                ;sse

-    vmlal.s16       q15, d23, d23

-    vpadal.s16      q13, q12                     ;sum

-    vmlal.s16       q14, d24, d24                ;sse

-    vmlal.s16       q15, d25, d25

-    subs            r12, r12, #1

-    vpadal.s16      q13, q0                     ;sum

-    vmlal.s16       q14, d0, d0                ;sse

-    vmlal.s16       q15, d1, d1

-    vpadal.s16      q13, q1                     ;sum

-    vmlal.s16       q14, d2, d2                ;sse

-    vmlal.s16       q15, d3, d3

-    vpadal.s16      q13, q5                     ;sum

-    vmlal.s16       q14, d10, d10                ;sse

-    vmlal.s16       q15, d11, d11

-    vmov            q0, q4

-    vpadal.s16      q13, q6                     ;sum

-    vmlal.s16       q14, d12, d12                ;sse

-    vmlal.s16       q15, d13, d13

-    bne             vp8_filt16x16s_4_4_loop_neon

-    vadd.u32        q15, q14, q15                ;accumulate sse

-    vpaddl.s32      q0, q13                      ;accumulate sum

-    vpaddl.u32      q1, q15

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [lr]               ;store sse

-    vshr.u32        d10, d10, #8

-    vsub.u32        d0, d1, d10

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {pc}

-    ENDP

-;==============================

-; r0    unsigned char  *src_ptr,

-; r1    int  src_pixels_per_line,

-; r2    int  xoffset,

-; r3    int  yoffset,

-; stack unsigned char *dst_ptr,

-; stack int dst_pixels_per_line,

-; stack unsigned int *sse

-;note: in vp8_find_best_half_pixel_step()(called when 8<Speed<15), and first call of vp8_find_best_sub_pixel_step()

-;(called when speed<=8). xoffset/yoffset can only be 4 or 0, which means either by pass the filter,

-;or filter coeff is {64, 64}. This simplified program only works in this situation.

-;note: It happens that both xoffset and yoffset are zero. This can be handled in c code later.

-|vp8_sub_pixel_variance16x16s_neon| PROC

-    push            {r4, lr}

-    vpush           {d8-d15}

-    ldr             r4, [sp, #72]           ;load *dst_ptr from stack

-    ldr             r12, [sp, #76]          ;load dst_pixels_per_line from stack

-    ldr             lr, [sp, #80]           ;load *sse from stack

-    cmp             r2, #0                  ;skip first_pass filter if xoffset=0

-    beq             secondpass_bfilter16x16s_only

-    cmp             r3, #0                  ;skip second_pass filter if yoffset=0

-    beq             firstpass_bfilter16x16s_only

-    vld1.u8         {d0, d1, d2, d3}, [r0], r1      ;load src data

-    sub             sp, sp, #256            ;reserve space on stack for temporary storage

-    vext.8          q1, q0, q1, #1          ;construct src_ptr[1]

-    mov             r3, sp

-    mov             r2, #4                  ;loop counter

-    vrhadd.u8       q0, q0, q1              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-;First Pass: output_height lines x output_width columns (17x16)

-vp8e_filt_blk2d_fp16x16s_loop_neon

-    vld1.u8         {d4, d5, d6, d7}, [r0], r1

-    vld1.u8         {d8, d9, d10, d11}, [r0], r1

-    vld1.u8         {d12, d13, d14, d15}, [r0], r1

-    vld1.u8         {d16, d17, d18, d19}, [r0], r1

-    ;pld                [r0]

-    ;pld                [r0, r1]

-    ;pld                [r0, r1, lsl #1]

-    vext.8          q3, q2, q3, #1          ;construct src_ptr[1]

-    vext.8          q5, q4, q5, #1

-    vext.8          q7, q6, q7, #1

-    vext.8          q9, q8, q9, #1

-    vrhadd.u8       q1, q2, q3              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-    vrhadd.u8       q2, q4, q5

-    vrhadd.u8       q3, q6, q7

-    vrhadd.u8       q4, q8, q9

-    vrhadd.u8       q0, q0, q1

-    vrhadd.u8       q1, q1, q2

-    vrhadd.u8       q2, q2, q3

-    vrhadd.u8       q3, q3, q4

-    subs            r2, r2, #1

-    vst1.u8         {d0, d1 ,d2, d3}, [r3]!         ;store result

-    vmov            q0, q4

-    vst1.u8         {d4, d5, d6, d7}, [r3]!

-    bne             vp8e_filt_blk2d_fp16x16s_loop_neon

-    b               sub_pixel_variance16x16s_neon

-;--------------------

-firstpass_bfilter16x16s_only

-    mov             r2, #2                  ;loop counter

-    sub             sp, sp, #256            ;reserve space on stack for temporary storage

-    mov             r3, sp

-;First Pass: output_height lines x output_width columns (16x16)

-vp8e_filt_blk2d_fpo16x16s_loop_neon

-    vld1.u8         {d0, d1, d2, d3}, [r0], r1      ;load src data

-    vld1.u8         {d4, d5, d6, d7}, [r0], r1

-    vld1.u8         {d8, d9, d10, d11}, [r0], r1

-    vld1.u8         {d12, d13, d14, d15}, [r0], r1

-    ;pld                [r0]

-    ;pld                [r0, r1]

-    ;pld                [r0, r1, lsl #1]

-    vext.8          q1, q0, q1, #1          ;construct src_ptr[1]

-    vld1.u8         {d16, d17, d18, d19}, [r0], r1

-    vext.8          q3, q2, q3, #1

-    vld1.u8         {d20, d21, d22, d23}, [r0], r1

-    vext.8          q5, q4, q5, #1

-    vld1.u8         {d24, d25, d26, d27}, [r0], r1

-    vext.8          q7, q6, q7, #1

-    vld1.u8         {d28, d29, d30, d31}, [r0], r1

-    vext.8          q9, q8, q9, #1

-    vext.8          q11, q10, q11, #1

-    vext.8          q13, q12, q13, #1

-    vext.8          q15, q14, q15, #1

-    vrhadd.u8       q0, q0, q1              ;(src_ptr[0]+src_ptr[1])/round/shift right 1

-    vrhadd.u8       q1, q2, q3

-    vrhadd.u8       q2, q4, q5

-    vrhadd.u8       q3, q6, q7

-    vrhadd.u8       q4, q8, q9

-    vrhadd.u8       q5, q10, q11

-    vrhadd.u8       q6, q12, q13

-    vrhadd.u8       q7, q14, q15

-    subs            r2, r2, #1

-    vst1.u8         {d0, d1, d2, d3}, [r3]!         ;store result

-    vst1.u8         {d4, d5, d6, d7}, [r3]!

-    vst1.u8         {d8, d9, d10, d11}, [r3]!

-    vst1.u8         {d12, d13, d14, d15}, [r3]!

-    bne             vp8e_filt_blk2d_fpo16x16s_loop_neon

-    b               sub_pixel_variance16x16s_neon

-;---------------------

-secondpass_bfilter16x16s_only

-    sub             sp, sp, #256            ;reserve space on stack for temporary storage

-    mov             r2, #2                  ;loop counter

-    vld1.u8         {d0, d1}, [r0], r1      ;load src data

-    mov             r3, sp

-vp8e_filt_blk2d_spo16x16s_loop_neon

-    vld1.u8         {d2, d3}, [r0], r1

-    vld1.u8         {d4, d5}, [r0], r1

-    vld1.u8         {d6, d7}, [r0], r1

-    vld1.u8         {d8, d9}, [r0], r1

-    vrhadd.u8       q0, q0, q1

-    vld1.u8         {d10, d11}, [r0], r1

-    vrhadd.u8       q1, q1, q2

-    vld1.u8         {d12, d13}, [r0], r1

-    vrhadd.u8       q2, q2, q3

-    vld1.u8         {d14, d15}, [r0], r1

-    vrhadd.u8       q3, q3, q4

-    vld1.u8         {d16, d17}, [r0], r1

-    vrhadd.u8       q4, q4, q5

-    vrhadd.u8       q5, q5, q6

-    vrhadd.u8       q6, q6, q7

-    vrhadd.u8       q7, q7, q8

-    subs            r2, r2, #1

-    vst1.u8         {d0, d1, d2, d3}, [r3]!         ;store result

-    vmov            q0, q8

-    vst1.u8         {d4, d5, d6, d7}, [r3]!

-    vst1.u8         {d8, d9, d10, d11}, [r3]!           ;store result

-    vst1.u8         {d12, d13, d14, d15}, [r3]!

-    bne             vp8e_filt_blk2d_spo16x16s_loop_neon

-    b               sub_pixel_variance16x16s_neon

-;----------------------------

-;variance16x16

-sub_pixel_variance16x16s_neon

-    vmov.i8         q8, #0                      ;q8 - sum

-    vmov.i8         q9, #0                      ;q9, q10 - sse

-    vmov.i8         q10, #0

-    sub             r3, r3, #256

-    mov             r2, #4

-sub_pixel_variance16x16s_neon_loop

-    vld1.8          {q0}, [r3]!                 ;Load up source and reference

-    vld1.8          {q1}, [r4], r12

-    vld1.8          {q2}, [r3]!

-    vld1.8          {q3}, [r4], r12

-    vld1.8          {q4}, [r3]!

-    vld1.8          {q5}, [r4], r12

-    vld1.8          {q6}, [r3]!

-    vld1.8          {q7}, [r4], r12

-    vsubl.u8        q11, d0, d2                 ;diff

-    vsubl.u8        q12, d1, d3

-    vsubl.u8        q13, d4, d6

-    vsubl.u8        q14, d5, d7

-    vsubl.u8        q0, d8, d10

-    vsubl.u8        q1, d9, d11

-    vsubl.u8        q2, d12, d14

-    vsubl.u8        q3, d13, d15

-    vpadal.s16      q8, q11                     ;sum

-    vmlal.s16       q9, d22, d22                ;sse

-    vmlal.s16       q10, d23, d23

-    subs            r2, r2, #1

-    vpadal.s16      q8, q12

-    vmlal.s16       q9, d24, d24

-    vmlal.s16       q10, d25, d25

-    vpadal.s16      q8, q13

-    vmlal.s16       q9, d26, d26

-    vmlal.s16       q10, d27, d27

-    vpadal.s16      q8, q14

-    vmlal.s16       q9, d28, d28

-    vmlal.s16       q10, d29, d29

-    vpadal.s16      q8, q0                     ;sum

-    vmlal.s16       q9, d0, d0                ;sse

-    vmlal.s16       q10, d1, d1

-    vpadal.s16      q8, q1

-    vmlal.s16       q9, d2, d2

-    vmlal.s16       q10, d3, d3

-    vpadal.s16      q8, q2

-    vmlal.s16       q9, d4, d4

-    vmlal.s16       q10, d5, d5

-    vpadal.s16      q8, q3

-    vmlal.s16       q9, d6, d6

-    vmlal.s16       q10, d7, d7

-    bne             sub_pixel_variance16x16s_neon_loop

-    vadd.u32        q10, q9, q10                ;accumulate sse

-    vpaddl.s32      q0, q8                      ;accumulate sum

-    vpaddl.u32      q1, q10

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [lr]               ;store sse

-    vshr.u32        d10, d10, #8

-    vsub.u32        d0, d1, d10

-    add             sp, sp, #256

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {r4, pc}

-    ENDP

-    END

--- a/vp8/common/arm/neon/vp8_subpixelvariance8x8_neon.asm

+++ /dev/null

@@ -1,225 +1,0 @@

-;

-;  Copyright (c) 2010 The WebM project authors. All Rights Reserved.

-;

-;  Use of this source code is governed by a BSD-style license

-;  that can be found in the LICENSE file in the root of the source

-;  tree. An additional intellectual property rights grant can be found

-;  in the file PATENTS.  All contributing project authors may

-;  be found in the AUTHORS file in the root of the source tree.

-;

-    EXPORT  |vp8_sub_pixel_variance8x8_neon|

-    ARM

-    REQUIRE8

-    PRESERVE8

-    AREA ||.text||, CODE, READONLY, ALIGN=2

-; r0    unsigned char  *src_ptr,

-; r1    int  src_pixels_per_line,

-; r2    int  xoffset,

-; r3    int  yoffset,

-; stack(r4) unsigned char *dst_ptr,

-; stack(r5) int dst_pixels_per_line,

-; stack(r6) unsigned int *sse

-;note: most of the code is copied from bilinear_predict8x8_neon and vp8_variance8x8_neon.

-|vp8_sub_pixel_variance8x8_neon| PROC

-    push            {r4-r5, lr}

-    vpush           {d8-d15}

-    adr             r12, bilinear_taps_coeff

-    ldr             r4, [sp, #76]           ;load *dst_ptr from stack

-    ldr             r5, [sp, #80]           ;load dst_pixels_per_line from stack

-    ldr             lr, [sp, #84]           ;load *sse from stack

-    cmp             r2, #0                  ;skip first_pass filter if xoffset=0

-    beq             skip_firstpass_filter

-;First pass: output_height lines x output_width columns (9x8)

-    add             r2, r12, r2, lsl #3     ;calculate filter location

-    vld1.u8         {q1}, [r0], r1          ;load src data

-    vld1.u32        {d31}, [r2]             ;load first_pass filter

-    vld1.u8         {q2}, [r0], r1

-    vdup.8          d0, d31[0]              ;first_pass filter (d0 d1)

-    vld1.u8         {q3}, [r0], r1

-    vdup.8          d1, d31[4]

-    vld1.u8         {q4}, [r0], r1

-    vmull.u8        q6, d2, d0              ;(src_ptr[0] * Filter[0])

-    vmull.u8        q7, d4, d0

-    vmull.u8        q8, d6, d0

-    vmull.u8        q9, d8, d0

-    vext.8          d3, d2, d3, #1          ;construct src_ptr[-1]

-    vext.8          d5, d4, d5, #1

-    vext.8          d7, d6, d7, #1

-    vext.8          d9, d8, d9, #1

-    vmlal.u8        q6, d3, d1              ;(src_ptr[1] * Filter[1])

-    vmlal.u8        q7, d5, d1

-    vmlal.u8        q8, d7, d1

-    vmlal.u8        q9, d9, d1

-    vld1.u8         {q1}, [r0], r1          ;load src data

-    vqrshrn.u16    d22, q6, #7              ;shift/round/saturate to u8

-    vld1.u8         {q2}, [r0], r1

-    vqrshrn.u16    d23, q7, #7

-    vld1.u8         {q3}, [r0], r1

-    vqrshrn.u16    d24, q8, #7

-    vld1.u8         {q4}, [r0], r1

-    vqrshrn.u16    d25, q9, #7

-    ;first_pass filtering on the rest 5-line data

-    vld1.u8         {q5}, [r0], r1

-    vmull.u8        q6, d2, d0              ;(src_ptr[0] * Filter[0])

-    vmull.u8        q7, d4, d0

-    vmull.u8        q8, d6, d0

-    vmull.u8        q9, d8, d0

-    vmull.u8        q10, d10, d0

-    vext.8          d3, d2, d3, #1          ;construct src_ptr[-1]

-    vext.8          d5, d4, d5, #1

-    vext.8          d7, d6, d7, #1

-    vext.8          d9, d8, d9, #1

-    vext.8          d11, d10, d11, #1

-    vmlal.u8        q6, d3, d1              ;(src_ptr[1] * Filter[1])

-    vmlal.u8        q7, d5, d1

-    vmlal.u8        q8, d7, d1

-    vmlal.u8        q9, d9, d1

-    vmlal.u8        q10, d11, d1

-    vqrshrn.u16    d26, q6, #7              ;shift/round/saturate to u8

-    vqrshrn.u16    d27, q7, #7

-    vqrshrn.u16    d28, q8, #7

-    vqrshrn.u16    d29, q9, #7

-    vqrshrn.u16    d30, q10, #7

-;Second pass: 8x8

-secondpass_filter

-    cmp             r3, #0                  ;skip second_pass filter if yoffset=0

-    ;skip_secondpass_filter

-    beq             sub_pixel_variance8x8_neon

-    add             r3, r12, r3, lsl #3

-    vld1.u32        {d31}, [r3]             ;load second_pass filter

-    vdup.8          d0, d31[0]              ;second_pass filter parameters (d0 d1)

-    vdup.8          d1, d31[4]

-    vmull.u8        q1, d22, d0             ;(src_ptr[0] * Filter[0])

-    vmull.u8        q2, d23, d0

-    vmull.u8        q3, d24, d0

-    vmull.u8        q4, d25, d0

-    vmull.u8        q5, d26, d0

-    vmull.u8        q6, d27, d0

-    vmull.u8        q7, d28, d0

-    vmull.u8        q8, d29, d0

-    vmlal.u8        q1, d23, d1             ;(src_ptr[pixel_step] * Filter[1])

-    vmlal.u8        q2, d24, d1

-    vmlal.u8        q3, d25, d1

-    vmlal.u8        q4, d26, d1

-    vmlal.u8        q5, d27, d1

-    vmlal.u8        q6, d28, d1

-    vmlal.u8        q7, d29, d1

-    vmlal.u8        q8, d30, d1

-    vqrshrn.u16    d22, q1, #7              ;shift/round/saturate to u8

-    vqrshrn.u16    d23, q2, #7

-    vqrshrn.u16    d24, q3, #7

-    vqrshrn.u16    d25, q4, #7

-    vqrshrn.u16    d26, q5, #7

-    vqrshrn.u16    d27, q6, #7

-    vqrshrn.u16    d28, q7, #7

-    vqrshrn.u16    d29, q8, #7

-    b               sub_pixel_variance8x8_neon

-;--------------------

-skip_firstpass_filter

-    vld1.u8         {d22}, [r0], r1         ;load src data

-    vld1.u8         {d23}, [r0], r1

-    vld1.u8         {d24}, [r0], r1

-    vld1.u8         {d25}, [r0], r1

-    vld1.u8         {d26}, [r0], r1

-    vld1.u8         {d27}, [r0], r1

-    vld1.u8         {d28}, [r0], r1

-    vld1.u8         {d29}, [r0], r1

-    vld1.u8         {d30}, [r0], r1

-    b               secondpass_filter

-;----------------------

-;vp8_variance8x8_neon

-sub_pixel_variance8x8_neon

-    vmov.i8         q8, #0                      ;q8 - sum

-    vmov.i8         q9, #0                      ;q9, q10 - sse

-    vmov.i8         q10, #0

-    mov             r12, #2

-sub_pixel_variance8x8_neon_loop

-    vld1.8          {d0}, [r4], r5              ;load dst data

-    subs            r12, r12, #1

-    vld1.8          {d1}, [r4], r5

-    vld1.8          {d2}, [r4], r5

-    vsubl.u8        q4, d22, d0                 ;calculate diff

-    vld1.8          {d3}, [r4], r5

-    vsubl.u8        q5, d23, d1

-    vsubl.u8        q6, d24, d2

-    vpadal.s16      q8, q4                      ;sum

-    vmlal.s16       q9, d8, d8                  ;sse

-    vmlal.s16       q10, d9, d9

-    vsubl.u8        q7, d25, d3

-    vpadal.s16      q8, q5

-    vmlal.s16       q9, d10, d10

-    vmlal.s16       q10, d11, d11

-    vmov            q11, q13

-    vpadal.s16      q8, q6

-    vmlal.s16       q9, d12, d12

-    vmlal.s16       q10, d13, d13

-    vmov            q12, q14

-    vpadal.s16      q8, q7

-    vmlal.s16       q9, d14, d14

-    vmlal.s16       q10, d15, d15

-    bne             sub_pixel_variance8x8_neon_loop

-    vadd.u32        q10, q9, q10                ;accumulate sse

-    vpaddl.s32      q0, q8                      ;accumulate sum

-    vpaddl.u32      q1, q10

-    vadd.s64        d0, d0, d1

-    vadd.u64        d1, d2, d3

-    vmull.s32       q5, d0, d0

-    vst1.32         {d1[0]}, [lr]               ;store sse

-    vshr.u32        d10, d10, #6

-    vsub.u32        d0, d1, d10

-    vmov.32         r0, d0[0]                   ;return

-    vpop            {d8-d15}

-    pop             {r4-r5, pc}

-    ENDP

-;-----------------

-bilinear_taps_coeff

-    DCD     128, 0, 112, 16, 96, 32, 80, 48, 64, 64, 48, 80, 32, 96, 16, 112

-    END

--- /dev/null

+++ b/vp8/common/arm/neon/vp8_subpixelvariance_neon.c

@@ -1,0 +1,1024 @@

+/*

+ *  Copyright (c) 2014 The WebM project authors. All Rights Reserved.

+ *

+ *  Use of this source code is governed by a BSD-style license

+ *  that can be found in the LICENSE file in the root of the source

+ *  tree. An additional intellectual property rights grant can be found

+ *  in the file PATENTS.  All contributing project authors may

+ *  be found in the AUTHORS file in the root of the source tree.

+ */

+#include <arm_neon.h>

+#include "vpx_ports/mem.h"

+#include "vpx/vpx_integer.h"

+static const uint16_t bilinear_taps_coeff[8][2] = {

+    {128,   0},

+    {112,  16},

+    { 96,  32},

+    { 80,  48},

+    { 64,  64},

+    { 48,  80},

+    { 32,  96},

+    { 16, 112}

+};

+unsigned int vp8_sub_pixel_variance16x16_neon_func(

+        const unsigned char *src_ptr,

+        int src_pixels_per_line,

+        int xoffset,

+        int yoffset,

+        const unsigned char *dst_ptr,

+        int dst_pixels_per_line,

+        unsigned int *sse) {

+    int i;

+    DECLARE_ALIGNED_ARRAY(16, unsigned char, tmp, 528);

+    unsigned char *tmpp;

+    unsigned char *tmpp2;

+    uint8x8_t d0u8, d1u8, d2u8, d3u8, d4u8, d5u8, d6u8, d7u8, d8u8, d9u8;

+    uint8x8_t d10u8, d11u8, d12u8, d13u8, d14u8, d15u8, d16u8, d17u8, d18u8;

+    uint8x8_t d19u8, d20u8, d21u8;

+    int16x4_t d22s16, d23s16, d24s16, d25s16, d26s16, d27s16, d28s16, d29s16;

+    uint32x2_t d0u32, d10u32;

+    int64_t d0s64, d1s64, d2s64, d3s64;

+    uint8x16_t q0u8, q1u8, q2u8, q3u8, q4u8, q5u8, q6u8, q7u8, q8u8, q9u8;

+    uint8x16_t q10u8, q11u8, q12u8, q13u8, q14u8, q15u8;

+    uint16x8_t q1u16, q2u16, q3u16, q4u16, q5u16, q6u16, q7u16, q8u16;

+    uint16x8_t q9u16, q10u16, q11u16, q12u16, q13u16, q14u16;

+    int32x4_t q8s32, q9s32, q10s32;

+    int64x2_t q0s64, q1s64, q5s64;

+    tmpp2 = tmp + 272;

+    tmpp = tmp;

+    if (xoffset == 0) {  // secondpass_bfilter16x16_only

+        d0u8 = vdup_n_u8(bilinear_taps_coeff[yoffset][0]);

+        d1u8 = vdup_n_u8(bilinear_taps_coeff[yoffset][1]);

+        q11u8 = vld1q_u8(src_ptr);

+        src_ptr += src_pixels_per_line;

+        for (i = 4; i > 0; i--) {

+            q12u8 = vld1q_u8(src_ptr);

+            src_ptr += src_pixels_per_line;

+            q13u8 = vld1q_u8(src_ptr);

+            src_ptr += src_pixels_per_line;

+            q14u8 = vld1q_u8(src_ptr);

+            src_ptr += src_pixels_per_line;

+            q15u8 = vld1q_u8(src_ptr);

+            src_ptr += src_pixels_per_line;

+            __builtin_prefetch(src_ptr);

+            __builtin_prefetch(src_ptr + src_pixels_per_line);

+            __builtin_prefetch(src_ptr + src_pixels_per_line * 2);

+            q1u16 = vmull_u8(vget_low_u8(q11u8), d0u8);

+            q2u16 = vmull_u8(vget_high_u8(q11u8), d0u8);

+            q3u16 = vmull_u8(vget_low_u8(q12u8), d0u8);

+            q4u16 = vmull_u8(vget_high_u8(q12u8), d0u8);

+            q5u16 = vmull_u8(vget_low_u8(q13u8), d0u8);

+            q6u16 = vmull_u8(vget_high_u8(q13u8), d0u8);

+            q7u16 = vmull_u8(vget_low_u8(q14u8), d0u8);

+            q8u16 = vmull_u8(vget_high_u8(q14u8), d0u8);

+            q1u16 = vmlal_u8(q1u16, vget_low_u8(q12u8), d1u8);

+            q2u16 = vmlal_u8(q2u16, vget_high_u8(q12u8), d1u8);

+            q3u16 = vmlal_u8(q3u16, vget_low_u8(q13u8), d1u8);

+            q4u16 = vmlal_u8(q4u16, vget_high_u8(q13u8), d1u8);

+            q5u16 = vmlal_u8(q5u16, vget_low_u8(q14u8), d1u8);

+            q6u16 = vmlal_u8(q6u16, vget_high_u8(q14u8), d1u8);

+            q7u16 = vmlal_u8(q7u16, vget_low_u8(q15u8), d1u8);

+            q8u16 = vmlal_u8(q8u16, vget_high_u8(q15u8), d1u8);

+            d2u8 = vqrshrn_n_u16(q1u16, 7);

+            d3u8 = vqrshrn_n_u16(q2u16, 7);

+            d4u8 = vqrshrn_n_u16(q3u16, 7);

+            d5u8 = vqrshrn_n_u16(q4u16, 7);

+            d6u8 = vqrshrn_n_u16(q5u16, 7);

+            d7u8 = vqrshrn_n_u16(q6u16, 7);

+            d8u8 = vqrshrn_n_u16(q7u16, 7);

+            d9u8 = vqrshrn_n_u16(q8u16, 7);

+            q1u8 = vcombine_u8(d2u8, d3u8);

+            q2u8 = vcombine_u8(d4u8, d5u8);

+            q3u8 = vcombine_u8(d6u8, d7u8);

+            q4u8 = vcombine_u8(d8u8, d9u8);

+            q11u8 = q15u8;

+            vst1q_u8((uint8_t *)tmpp2, q1u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q2u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q3u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q4u8);

+            tmpp2 += 16;

+        }

+    } else if (yoffset == 0) {  // firstpass_bfilter16x16_only

+        d0u8 = vdup_n_u8(bilinear_taps_coeff[xoffset][0]);

+        d1u8 = vdup_n_u8(bilinear_taps_coeff[xoffset][1]);

+        for (i = 4; i > 0 ; i--) {

+            d2u8 = vld1_u8(src_ptr);

+            d3u8 = vld1_u8(src_ptr + 8);

+            d4u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d5u8 = vld1_u8(src_ptr);

+            d6u8 = vld1_u8(src_ptr + 8);

+            d7u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d8u8 = vld1_u8(src_ptr);

+            d9u8 = vld1_u8(src_ptr + 8);

+            d10u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d11u8 = vld1_u8(src_ptr);

+            d12u8 = vld1_u8(src_ptr + 8);

+            d13u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            __builtin_prefetch(src_ptr);

+            __builtin_prefetch(src_ptr + src_pixels_per_line);

+            __builtin_prefetch(src_ptr + src_pixels_per_line * 2);

+            q7u16  = vmull_u8(d2u8, d0u8);

+            q8u16  = vmull_u8(d3u8, d0u8);

+            q9u16  = vmull_u8(d5u8, d0u8);

+            q10u16 = vmull_u8(d6u8, d0u8);

+            q11u16 = vmull_u8(d8u8, d0u8);

+            q12u16 = vmull_u8(d9u8, d0u8);

+            q13u16 = vmull_u8(d11u8, d0u8);

+            q14u16 = vmull_u8(d12u8, d0u8);

+            d2u8  = vext_u8(d2u8, d3u8, 1);

+            d5u8  = vext_u8(d5u8, d6u8, 1);

+            d8u8  = vext_u8(d8u8, d9u8, 1);

+            d11u8 = vext_u8(d11u8, d12u8, 1);

+            q7u16  = vmlal_u8(q7u16, d2u8, d1u8);

+            q9u16  = vmlal_u8(q9u16, d5u8, d1u8);

+            q11u16 = vmlal_u8(q11u16, d8u8, d1u8);

+            q13u16 = vmlal_u8(q13u16, d11u8, d1u8);

+            d3u8  = vext_u8(d3u8, d4u8, 1);

+            d6u8  = vext_u8(d6u8, d7u8, 1);

+            d9u8  = vext_u8(d9u8, d10u8, 1);

+            d12u8 = vext_u8(d12u8, d13u8, 1);

+            q8u16  = vmlal_u8(q8u16,  d3u8, d1u8);

+            q10u16 = vmlal_u8(q10u16, d6u8, d1u8);

+            q12u16 = vmlal_u8(q12u16, d9u8, d1u8);

+            q14u16 = vmlal_u8(q14u16, d12u8, d1u8);

+            d14u8 = vqrshrn_n_u16(q7u16, 7);

+            d15u8 = vqrshrn_n_u16(q8u16, 7);

+            d16u8 = vqrshrn_n_u16(q9u16, 7);

+            d17u8 = vqrshrn_n_u16(q10u16, 7);

+            d18u8 = vqrshrn_n_u16(q11u16, 7);

+            d19u8 = vqrshrn_n_u16(q12u16, 7);

+            d20u8 = vqrshrn_n_u16(q13u16, 7);

+            d21u8 = vqrshrn_n_u16(q14u16, 7);

+            q7u8  = vcombine_u8(d14u8, d15u8);

+            q8u8  = vcombine_u8(d16u8, d17u8);

+            q9u8  = vcombine_u8(d18u8, d19u8);

+            q10u8 = vcombine_u8(d20u8, d21u8);

+            vst1q_u8((uint8_t *)tmpp2, q7u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q8u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q9u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q10u8);

+            tmpp2 += 16;

+        }

+    } else {

+        d0u8 = vdup_n_u8(bilinear_taps_coeff[xoffset][0]);

+        d1u8 = vdup_n_u8(bilinear_taps_coeff[xoffset][1]);

+        d2u8 = vld1_u8(src_ptr);

+        d3u8 = vld1_u8(src_ptr + 8);

+        d4u8 = vld1_u8(src_ptr + 16);

+        src_ptr += src_pixels_per_line;

+        d5u8 = vld1_u8(src_ptr);

+        d6u8 = vld1_u8(src_ptr + 8);

+        d7u8 = vld1_u8(src_ptr + 16);

+        src_ptr += src_pixels_per_line;

+        d8u8 = vld1_u8(src_ptr);

+        d9u8 = vld1_u8(src_ptr + 8);

+        d10u8 = vld1_u8(src_ptr + 16);

+        src_ptr += src_pixels_per_line;

+        d11u8 = vld1_u8(src_ptr);

+        d12u8 = vld1_u8(src_ptr + 8);

+        d13u8 = vld1_u8(src_ptr + 16);

+        src_ptr += src_pixels_per_line;

+        // First Pass: output_height lines x output_width columns (17x16)

+        for (i = 3; i > 0; i--) {

+            q7u16  = vmull_u8(d2u8, d0u8);

+            q8u16  = vmull_u8(d3u8, d0u8);

+            q9u16  = vmull_u8(d5u8, d0u8);

+            q10u16 = vmull_u8(d6u8, d0u8);

+            q11u16 = vmull_u8(d8u8, d0u8);

+            q12u16 = vmull_u8(d9u8, d0u8);

+            q13u16 = vmull_u8(d11u8, d0u8);

+            q14u16 = vmull_u8(d12u8, d0u8);

+            d2u8  = vext_u8(d2u8, d3u8, 1);

+            d5u8  = vext_u8(d5u8, d6u8, 1);

+            d8u8  = vext_u8(d8u8, d9u8, 1);

+            d11u8 = vext_u8(d11u8, d12u8, 1);

+            q7u16  = vmlal_u8(q7u16, d2u8, d1u8);

+            q9u16  = vmlal_u8(q9u16, d5u8, d1u8);

+            q11u16 = vmlal_u8(q11u16, d8u8, d1u8);

+            q13u16 = vmlal_u8(q13u16, d11u8, d1u8);

+            d3u8  = vext_u8(d3u8, d4u8, 1);

+            d6u8  = vext_u8(d6u8, d7u8, 1);

+            d9u8  = vext_u8(d9u8, d10u8, 1);

+            d12u8 = vext_u8(d12u8, d13u8, 1);

+            q8u16  = vmlal_u8(q8u16,  d3u8, d1u8);

+            q10u16 = vmlal_u8(q10u16, d6u8, d1u8);

+            q12u16 = vmlal_u8(q12u16, d9u8, d1u8);

+            q14u16 = vmlal_u8(q14u16, d12u8, d1u8);

+            d14u8 = vqrshrn_n_u16(q7u16, 7);

+            d15u8 = vqrshrn_n_u16(q8u16, 7);

+            d16u8 = vqrshrn_n_u16(q9u16, 7);

+            d17u8 = vqrshrn_n_u16(q10u16, 7);

+            d18u8 = vqrshrn_n_u16(q11u16, 7);

+            d19u8 = vqrshrn_n_u16(q12u16, 7);

+            d20u8 = vqrshrn_n_u16(q13u16, 7);

+            d21u8 = vqrshrn_n_u16(q14u16, 7);

+            d2u8 = vld1_u8(src_ptr);

+            d3u8 = vld1_u8(src_ptr + 8);

+            d4u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d5u8 = vld1_u8(src_ptr);

+            d6u8 = vld1_u8(src_ptr + 8);

+            d7u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d8u8 = vld1_u8(src_ptr);

+            d9u8 = vld1_u8(src_ptr + 8);

+            d10u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            d11u8 = vld1_u8(src_ptr);

+            d12u8 = vld1_u8(src_ptr + 8);

+            d13u8 = vld1_u8(src_ptr + 16);

+            src_ptr += src_pixels_per_line;

+            q7u8 = vcombine_u8(d14u8, d15u8);

+            q8u8 = vcombine_u8(d16u8, d17u8);

+            q9u8 = vcombine_u8(d18u8, d19u8);

+            q10u8 = vcombine_u8(d20u8, d21u8);

+            vst1q_u8((uint8_t *)tmpp, q7u8);

+            tmpp += 16;

+            vst1q_u8((uint8_t *)tmpp, q8u8);

+            tmpp += 16;

+            vst1q_u8((uint8_t *)tmpp, q9u8);

+            tmpp += 16;

+            vst1q_u8((uint8_t *)tmpp, q10u8);

+            tmpp += 16;

+        }

+        // First-pass filtering for rest 5 lines

+        d14u8 = vld1_u8(src_ptr);

+        d15u8 = vld1_u8(src_ptr + 8);

+        d16u8 = vld1_u8(src_ptr + 16);

+        src_ptr += src_pixels_per_line;

+        q9u16  = vmull_u8(d2u8, d0u8);

+        q10u16 = vmull_u8(d3u8, d0u8);

+        q11u16 = vmull_u8(d5u8, d0u8);

+        q12u16 = vmull_u8(d6u8, d0u8);

+        q13u16 = vmull_u8(d8u8, d0u8);

+        q14u16 = vmull_u8(d9u8, d0u8);

+        d2u8  = vext_u8(d2u8, d3u8, 1);

+        d5u8  = vext_u8(d5u8, d6u8, 1);

+        d8u8  = vext_u8(d8u8, d9u8, 1);

+        q9u16  = vmlal_u8(q9u16, d2u8, d1u8);

+        q11u16 = vmlal_u8(q11u16, d5u8, d1u8);

+        q13u16 = vmlal_u8(q13u16, d8u8, d1u8);

+        d3u8  = vext_u8(d3u8, d4u8, 1);

+        d6u8  = vext_u8(d6u8, d7u8, 1);

+        d9u8  = vext_u8(d9u8, d10u8, 1);

+        q10u16 = vmlal_u8(q10u16, d3u8, d1u8);

+        q12u16 = vmlal_u8(q12u16, d6u8, d1u8);

+        q14u16 = vmlal_u8(q14u16, d9u8, d1u8);

+        q1u16 = vmull_u8(d11u8, d0u8);

+        q2u16 = vmull_u8(d12u8, d0u8);

+        q3u16 = vmull_u8(d14u8, d0u8);

+        q4u16 = vmull_u8(d15u8, d0u8);

+        d11u8 = vext_u8(d11u8, d12u8, 1);

+        d14u8 = vext_u8(d14u8, d15u8, 1);

+        q1u16 = vmlal_u8(q1u16, d11u8, d1u8);

+        q3u16 = vmlal_u8(q3u16, d14u8, d1u8);

+        d12u8 = vext_u8(d12u8, d13u8, 1);

+        d15u8 = vext_u8(d15u8, d16u8, 1);

+        q2u16 = vmlal_u8(q2u16, d12u8, d1u8);

+        q4u16 = vmlal_u8(q4u16, d15u8, d1u8);

+        d10u8 = vqrshrn_n_u16(q9u16, 7);

+        d11u8 = vqrshrn_n_u16(q10u16, 7);

+        d12u8 = vqrshrn_n_u16(q11u16, 7);

+        d13u8 = vqrshrn_n_u16(q12u16, 7);

+        d14u8 = vqrshrn_n_u16(q13u16, 7);

+        d15u8 = vqrshrn_n_u16(q14u16, 7);

+        d16u8 = vqrshrn_n_u16(q1u16, 7);

+        d17u8 = vqrshrn_n_u16(q2u16, 7);

+        d18u8 = vqrshrn_n_u16(q3u16, 7);

+        d19u8 = vqrshrn_n_u16(q4u16, 7);

+        q5u8 = vcombine_u8(d10u8, d11u8);

+        q6u8 = vcombine_u8(d12u8, d13u8);

+        q7u8 = vcombine_u8(d14u8, d15u8);

+        q8u8 = vcombine_u8(d16u8, d17u8);

+        q9u8 = vcombine_u8(d18u8, d19u8);

+        vst1q_u8((uint8_t *)tmpp, q5u8);

+        tmpp += 16;

+        vst1q_u8((uint8_t *)tmpp, q6u8);

+        tmpp += 16;

+        vst1q_u8((uint8_t *)tmpp, q7u8);

+        tmpp += 16;

+        vst1q_u8((uint8_t *)tmpp, q8u8);

+        tmpp += 16;

+        vst1q_u8((uint8_t *)tmpp, q9u8);

+        // secondpass_filter

+        d0u8 = vdup_n_u8(bilinear_taps_coeff[yoffset][0]);

+        d1u8 = vdup_n_u8(bilinear_taps_coeff[yoffset][1]);

+        tmpp = tmp;

+        tmpp2 = tmpp + 272;

+        q11u8 = vld1q_u8(tmpp);

+        tmpp += 16;

+        for (i = 4; i > 0; i--) {

+            q12u8 = vld1q_u8(tmpp);

+            tmpp += 16;

+            q13u8 = vld1q_u8(tmpp);

+            tmpp += 16;

+            q14u8 = vld1q_u8(tmpp);

+            tmpp += 16;

+            q15u8 = vld1q_u8(tmpp);

+            tmpp += 16;

+            q1u16 = vmull_u8(vget_low_u8(q11u8), d0u8);

+            q2u16 = vmull_u8(vget_high_u8(q11u8), d0u8);

+            q3u16 = vmull_u8(vget_low_u8(q12u8), d0u8);

+            q4u16 = vmull_u8(vget_high_u8(q12u8), d0u8);

+            q5u16 = vmull_u8(vget_low_u8(q13u8), d0u8);

+            q6u16 = vmull_u8(vget_high_u8(q13u8), d0u8);

+            q7u16 = vmull_u8(vget_low_u8(q14u8), d0u8);

+            q8u16 = vmull_u8(vget_high_u8(q14u8), d0u8);

+            q1u16 = vmlal_u8(q1u16, vget_low_u8(q12u8), d1u8);

+            q2u16 = vmlal_u8(q2u16, vget_high_u8(q12u8), d1u8);

+            q3u16 = vmlal_u8(q3u16, vget_low_u8(q13u8), d1u8);

+            q4u16 = vmlal_u8(q4u16, vget_high_u8(q13u8), d1u8);

+            q5u16 = vmlal_u8(q5u16, vget_low_u8(q14u8), d1u8);

+            q6u16 = vmlal_u8(q6u16, vget_high_u8(q14u8), d1u8);

+            q7u16 = vmlal_u8(q7u16, vget_low_u8(q15u8), d1u8);

+            q8u16 = vmlal_u8(q8u16, vget_high_u8(q15u8), d1u8);

+            d2u8 = vqrshrn_n_u16(q1u16, 7);

+            d3u8 = vqrshrn_n_u16(q2u16, 7);

+            d4u8 = vqrshrn_n_u16(q3u16, 7);

+            d5u8 = vqrshrn_n_u16(q4u16, 7);

+            d6u8 = vqrshrn_n_u16(q5u16, 7);

+            d7u8 = vqrshrn_n_u16(q6u16, 7);

+            d8u8 = vqrshrn_n_u16(q7u16, 7);

+            d9u8 = vqrshrn_n_u16(q8u16, 7);

+            q1u8 = vcombine_u8(d2u8, d3u8);

+            q2u8 = vcombine_u8(d4u8, d5u8);

+            q3u8 = vcombine_u8(d6u8, d7u8);

+            q4u8 = vcombine_u8(d8u8, d9u8);

+            q11u8 = q15u8;

+            vst1q_u8((uint8_t *)tmpp2, q1u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q2u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q3u8);

+            tmpp2 += 16;

+            vst1q_u8((uint8_t *)tmpp2, q4u8);

+            tmpp2 += 16;

+        }

+    }

+    // sub_pixel_variance16x16_neon

+    q8s32 = vdupq_n_s32(0);

+    q9s32 = vdupq_n_s32(0);

+    q10s32 = vdupq_n_s32(0);

+    tmpp = tmp + 272;

+    for (i = 0; i < 8; i++) {  // sub_pixel_variance16x16_neon_loop

+        q0u8 = vld1q_u8(tmpp);

+        tmpp += 16;

+        q1u8 = vld1q_u8(tmpp);

+        tmpp += 16;

+        q2u8 = vld1q_u8(dst_ptr);

+        dst_ptr += dst_pixels_per_line;

+        q3u8 = vld1q_u8(dst_ptr);

+        dst_ptr += dst_pixels_per_line;

+        d0u8 = vget_low_u8(q0u8);

+        d1u8 = vget_high_u8(q0u8);

+        d2u8 = vget_low_u8(q1u8);

+        d3u8 = vget_high_u8(q1u8);

+        q11u16 = vsubl_u8(d0u8, vget_low_u8(q2u8));

+        q12u16 = vsubl_u8(d1u8, vget_high_u8(q2u8));

+        q13u16 = vsubl_u8(d2u8, vget_low_u8(q3u8));

+        q14u16 = vsubl_u8(d3u8, vget_high_u8(q3u8));

+        d22s16 = vreinterpret_s16_u16(vget_low_u16(q11u16));

+        d23s16 = vreinterpret_s16_u16(vget_high_u16(q11u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q11u16));

+        q9s32 = vmlal_s16(q9s32, d22s16, d22s16);

+        q10s32 = vmlal_s16(q10s32, d23s16, d23s16);

+        d24s16 = vreinterpret_s16_u16(vget_low_u16(q12u16));

+        d25s16 = vreinterpret_s16_u16(vget_high_u16(q12u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q12u16));

+        q9s32 = vmlal_s16(q9s32, d24s16, d24s16);

+        q10s32 = vmlal_s16(q10s32, d25s16, d25s16);

+        d26s16 = vreinterpret_s16_u16(vget_low_u16(q13u16));

+        d27s16 = vreinterpret_s16_u16(vget_high_u16(q13u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q13u16));

+        q9s32 = vmlal_s16(q9s32, d26s16, d26s16);

+        q10s32 = vmlal_s16(q10s32, d27s16, d27s16);

+        d28s16 = vreinterpret_s16_u16(vget_low_u16(q14u16));

+        d29s16 = vreinterpret_s16_u16(vget_high_u16(q14u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q14u16));

+        q9s32 = vmlal_s16(q9s32, d28s16, d28s16);

+        q10s32 = vmlal_s16(q10s32, d29s16, d29s16);

+    }

+    q10s32 = vaddq_s32(q10s32, q9s32);

+    q0s64 = vpaddlq_s32(q8s32);

+    q1s64 = vpaddlq_s32(q10s32);

+    d0s64 = vget_low_s64(q0s64);

+    d1s64 = vget_high_s64(q0s64);

+    d2s64 = vget_low_s64(q1s64);

+    d3s64 = vget_high_s64(q1s64);

+    d0s64 = vadd_s64(d0s64, d1s64);

+    d1s64 = vadd_s64(d2s64, d3s64);

+    q5s64 = vmull_s32(vreinterpret_s32_s64(d0s64),

+                      vreinterpret_s32_s64(d0s64));

+    vst1_lane_u32((uint32_t *)sse, vreinterpret_u32_s64(d1s64), 0);

+    d10u32 = vshr_n_u32(vreinterpret_u32_s64(vget_low_s64(q5s64)), 8);

+    d0u32 = vsub_u32(vreinterpret_u32_s64(d1s64), d10u32);

+    return vget_lane_u32(d0u32, 0);

+}

+unsigned int vp8_variance_halfpixvar16x16_h_neon(

+        const unsigned char *src_ptr,

+        int  source_stride,

+        const unsigned char *ref_ptr,

+        int  recon_stride,

+        unsigned int *sse) {

+    int i;

+    uint8x8_t d0u8, d1u8, d2u8, d3u8, d4u8, d5u8, d6u8, d7u8;

+    int16x4_t d0s16, d1s16, d2s16, d3s16, d4s16, d5s16, d6s16, d7s16;

+    int16x4_t d8s16, d9s16, d10s16, d11s16, d12s16, d13s16, d14s16, d15s16;

+    uint32x2_t d0u32, d10u32;

+    int64_t d0s64, d1s64, d2s64, d3s64;

+    uint8x16_t q0u8, q1u8, q2u8, q3u8, q4u8, q5u8, q6u8;

+    uint8x16_t q7u8, q11u8, q12u8, q13u8, q14u8;

+    uint16x8_t q0u16, q1u16, q2u16, q3u16, q4u16, q5u16, q6u16, q7u16;

+    int32x4_t q8s32, q9s32, q10s32;

+    int64x2_t q0s64, q1s64, q5s64;

+    q8s32 = vdupq_n_s32(0);

+    q9s32 = vdupq_n_s32(0);

+    q10s32 = vdupq_n_s32(0);

+    for (i = 0; i < 4; i++) {  // vp8_filt_fpo16x16s_4_0_loop_neon

+        q0u8 = vld1q_u8(src_ptr);

+        q1u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q2u8 = vld1q_u8(src_ptr);

+        q3u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q4u8 = vld1q_u8(src_ptr);

+        q5u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q6u8 = vld1q_u8(src_ptr);

+        q7u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q11u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q12u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q13u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q14u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q1u8 = vextq_u8(q0u8, q1u8, 1);

+        q3u8 = vextq_u8(q2u8, q3u8, 1);

+        q5u8 = vextq_u8(q4u8, q5u8, 1);

+        q7u8 = vextq_u8(q6u8, q7u8, 1);

+        q0u8 = vrhaddq_u8(q0u8, q1u8);

+        q1u8 = vrhaddq_u8(q2u8, q3u8);

+        q2u8 = vrhaddq_u8(q4u8, q5u8);

+        q3u8 = vrhaddq_u8(q6u8, q7u8);

+        d0u8 = vget_low_u8(q0u8);

+        d1u8 = vget_high_u8(q0u8);

+        d2u8 = vget_low_u8(q1u8);

+        d3u8 = vget_high_u8(q1u8);

+        d4u8 = vget_low_u8(q2u8);

+        d5u8 = vget_high_u8(q2u8);

+        d6u8 = vget_low_u8(q3u8);

+        d7u8 = vget_high_u8(q3u8);

+        q4u16 = vsubl_u8(d0u8, vget_low_u8(q11u8));

+        q5u16 = vsubl_u8(d1u8, vget_high_u8(q11u8));

+        q6u16 = vsubl_u8(d2u8, vget_low_u8(q12u8));

+        q7u16 = vsubl_u8(d3u8, vget_high_u8(q12u8));

+        q0u16 = vsubl_u8(d4u8, vget_low_u8(q13u8));

+        q1u16 = vsubl_u8(d5u8, vget_high_u8(q13u8));

+        q2u16 = vsubl_u8(d6u8, vget_low_u8(q14u8));

+        q3u16 = vsubl_u8(d7u8, vget_high_u8(q14u8));

+        d8s16 = vreinterpret_s16_u16(vget_low_u16(q4u16));

+        d9s16 = vreinterpret_s16_u16(vget_high_u16(q4u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q4u16));

+        q9s32 = vmlal_s16(q9s32, d8s16, d8s16);

+        q10s32 = vmlal_s16(q10s32, d9s16, d9s16);

+        d10s16 = vreinterpret_s16_u16(vget_low_u16(q5u16));

+        d11s16 = vreinterpret_s16_u16(vget_high_u16(q5u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q5u16));

+        q9s32 = vmlal_s16(q9s32, d10s16, d10s16);

+        q10s32 = vmlal_s16(q10s32, d11s16, d11s16);

+        d12s16 = vreinterpret_s16_u16(vget_low_u16(q6u16));

+        d13s16 = vreinterpret_s16_u16(vget_high_u16(q6u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q6u16));

+        q9s32 = vmlal_s16(q9s32, d12s16, d12s16);

+        q10s32 = vmlal_s16(q10s32, d13s16, d13s16);

+        d14s16 = vreinterpret_s16_u16(vget_low_u16(q7u16));

+        d15s16 = vreinterpret_s16_u16(vget_high_u16(q7u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q7u16));

+        q9s32 = vmlal_s16(q9s32, d14s16, d14s16);

+        q10s32 = vmlal_s16(q10s32, d15s16, d15s16);

+        d0s16 = vreinterpret_s16_u16(vget_low_u16(q0u16));

+        d1s16 = vreinterpret_s16_u16(vget_high_u16(q0u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q0u16));

+        q9s32 = vmlal_s16(q9s32, d0s16, d0s16);

+        q10s32 = vmlal_s16(q10s32, d1s16, d1s16);

+        d2s16 = vreinterpret_s16_u16(vget_low_u16(q1u16));

+        d3s16 = vreinterpret_s16_u16(vget_high_u16(q1u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q1u16));

+        q9s32 = vmlal_s16(q9s32, d2s16, d2s16);

+        q10s32 = vmlal_s16(q10s32, d3s16, d3s16);

+        d4s16 = vreinterpret_s16_u16(vget_low_u16(q2u16));

+        d5s16 = vreinterpret_s16_u16(vget_high_u16(q2u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q2u16));

+        q9s32 = vmlal_s16(q9s32, d4s16, d4s16);

+        q10s32 = vmlal_s16(q10s32, d5s16, d5s16);

+        d6s16 = vreinterpret_s16_u16(vget_low_u16(q3u16));

+        d7s16 = vreinterpret_s16_u16(vget_high_u16(q3u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q3u16));

+        q9s32 = vmlal_s16(q9s32, d6s16, d6s16);

+        q10s32 = vmlal_s16(q10s32, d7s16, d7s16);

+    }

+    q10s32 = vaddq_s32(q10s32, q9s32);

+    q0s64 = vpaddlq_s32(q8s32);

+    q1s64 = vpaddlq_s32(q10s32);

+    d0s64 = vget_low_s64(q0s64);

+    d1s64 = vget_high_s64(q0s64);

+    d2s64 = vget_low_s64(q1s64);

+    d3s64 = vget_high_s64(q1s64);

+    d0s64 = vadd_s64(d0s64, d1s64);

+    d1s64 = vadd_s64(d2s64, d3s64);

+    q5s64 = vmull_s32(vreinterpret_s32_s64(d0s64),

+                      vreinterpret_s32_s64(d0s64));

+    vst1_lane_u32((uint32_t *)sse, vreinterpret_u32_s64(d1s64), 0);

+    d10u32 = vshr_n_u32(vreinterpret_u32_s64(vget_low_s64(q5s64)), 8);

+    d0u32 = vsub_u32(vreinterpret_u32_s64(d1s64), d10u32);

+    return vget_lane_u32(d0u32, 0);

+}

+unsigned int vp8_variance_halfpixvar16x16_v_neon(

+        const unsigned char *src_ptr,

+        int  source_stride,

+        const unsigned char *ref_ptr,

+        int  recon_stride,

+        unsigned int *sse) {

+    int i;

+    uint8x8_t d0u8, d1u8, d4u8, d5u8, d8u8, d9u8, d12u8, d13u8;

+    int16x4_t d22s16, d23s16, d24s16, d25s16, d26s16, d27s16, d28s16, d29s16;

+    int16x4_t d0s16, d1s16, d2s16, d3s16, d4s16, d5s16, d6s16, d7s16;

+    uint32x2_t d0u32, d10u32;

+    int64_t d0s64, d1s64, d2s64, d3s64;

+    uint8x16_t q0u8, q1u8, q2u8, q3u8, q4u8, q5u8, q6u8, q7u8, q15u8;

+    uint16x8_t q0u16, q1u16, q2u16, q3u16, q11u16, q12u16, q13u16, q14u16;

+    int32x4_t q8s32, q9s32, q10s32;

+    int64x2_t q0s64, q1s64, q5s64;

+    q8s32 = vdupq_n_s32(0);

+    q9s32 = vdupq_n_s32(0);

+    q10s32 = vdupq_n_s32(0);

+    q0u8 = vld1q_u8(src_ptr);

+    src_ptr += source_stride;

+    for (i = 0; i < 4; i++) {  // vp8_filt_fpo16x16s_4_0_loop_neon

+        q2u8 = vld1q_u8(src_ptr);

+        src_ptr += source_stride;

+        q4u8 = vld1q_u8(src_ptr);

+        src_ptr += source_stride;

+        q6u8 = vld1q_u8(src_ptr);

+        src_ptr += source_stride;

+        q15u8 = vld1q_u8(src_ptr);

+        src_ptr += source_stride;

+        q1u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q3u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q5u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q7u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q0u8 = vrhaddq_u8(q0u8, q2u8);

+        q2u8 = vrhaddq_u8(q2u8, q4u8);

+        q4u8 = vrhaddq_u8(q4u8, q6u8);

+        q6u8 = vrhaddq_u8(q6u8, q15u8);

+        d0u8  = vget_low_u8(q0u8);

+        d1u8  = vget_high_u8(q0u8);

+        d4u8  = vget_low_u8(q2u8);

+        d5u8  = vget_high_u8(q2u8);

+        d8u8  = vget_low_u8(q4u8);

+        d9u8  = vget_high_u8(q4u8);

+        d12u8 = vget_low_u8(q6u8);

+        d13u8 = vget_high_u8(q6u8);

+        q11u16 = vsubl_u8(d0u8, vget_low_u8(q1u8));

+        q12u16 = vsubl_u8(d1u8, vget_high_u8(q1u8));

+        q13u16 = vsubl_u8(d4u8, vget_low_u8(q3u8));

+        q14u16 = vsubl_u8(d5u8, vget_high_u8(q3u8));

+        q0u16  = vsubl_u8(d8u8, vget_low_u8(q5u8));

+        q1u16  = vsubl_u8(d9u8, vget_high_u8(q5u8));

+        q2u16  = vsubl_u8(d12u8, vget_low_u8(q7u8));

+        q3u16  = vsubl_u8(d13u8, vget_high_u8(q7u8));

+        d22s16 = vreinterpret_s16_u16(vget_low_u16(q11u16));

+        d23s16 = vreinterpret_s16_u16(vget_high_u16(q11u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q11u16));

+        q9s32 = vmlal_s16(q9s32, d22s16, d22s16);

+        q10s32 = vmlal_s16(q10s32, d23s16, d23s16);

+        d24s16 = vreinterpret_s16_u16(vget_low_u16(q12u16));

+        d25s16 = vreinterpret_s16_u16(vget_high_u16(q12u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q12u16));

+        q9s32 = vmlal_s16(q9s32, d24s16, d24s16);

+        q10s32 = vmlal_s16(q10s32, d25s16, d25s16);

+        d26s16 = vreinterpret_s16_u16(vget_low_u16(q13u16));

+        d27s16 = vreinterpret_s16_u16(vget_high_u16(q13u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q13u16));

+        q9s32 = vmlal_s16(q9s32, d26s16, d26s16);

+        q10s32 = vmlal_s16(q10s32, d27s16, d27s16);

+        d28s16 = vreinterpret_s16_u16(vget_low_u16(q14u16));

+        d29s16 = vreinterpret_s16_u16(vget_high_u16(q14u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q14u16));

+        q9s32 = vmlal_s16(q9s32, d28s16, d28s16);

+        q10s32 = vmlal_s16(q10s32, d29s16, d29s16);

+        d0s16 = vreinterpret_s16_u16(vget_low_u16(q0u16));

+        d1s16 = vreinterpret_s16_u16(vget_high_u16(q0u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q0u16));

+        q9s32 = vmlal_s16(q9s32, d0s16, d0s16);

+        q10s32 = vmlal_s16(q10s32, d1s16, d1s16);

+        d2s16 = vreinterpret_s16_u16(vget_low_u16(q1u16));

+        d3s16 = vreinterpret_s16_u16(vget_high_u16(q1u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q1u16));

+        q9s32 = vmlal_s16(q9s32, d2s16, d2s16);

+        q10s32 = vmlal_s16(q10s32, d3s16, d3s16);

+        d4s16 = vreinterpret_s16_u16(vget_low_u16(q2u16));

+        d5s16 = vreinterpret_s16_u16(vget_high_u16(q2u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q2u16));

+        q9s32 = vmlal_s16(q9s32, d4s16, d4s16);

+        q10s32 = vmlal_s16(q10s32, d5s16, d5s16);

+        d6s16 = vreinterpret_s16_u16(vget_low_u16(q3u16));

+        d7s16 = vreinterpret_s16_u16(vget_high_u16(q3u16));

+        q8s32 = vpadalq_s16(q8s32, vreinterpretq_s16_u16(q3u16));

+        q9s32 = vmlal_s16(q9s32, d6s16, d6s16);

+        q10s32 = vmlal_s16(q10s32, d7s16, d7s16);

+        q0u8 = q15u8;

+    }

+    q10s32 = vaddq_s32(q10s32, q9s32);

+    q0s64 = vpaddlq_s32(q8s32);

+    q1s64 = vpaddlq_s32(q10s32);

+    d0s64 = vget_low_s64(q0s64);

+    d1s64 = vget_high_s64(q0s64);

+    d2s64 = vget_low_s64(q1s64);

+    d3s64 = vget_high_s64(q1s64);

+    d0s64 = vadd_s64(d0s64, d1s64);

+    d1s64 = vadd_s64(d2s64, d3s64);

+    q5s64 = vmull_s32(vreinterpret_s32_s64(d0s64),

+                      vreinterpret_s32_s64(d0s64));

+    vst1_lane_u32((uint32_t *)sse, vreinterpret_u32_s64(d1s64), 0);

+    d10u32 = vshr_n_u32(vreinterpret_u32_s64(vget_low_s64(q5s64)), 8);

+    d0u32 = vsub_u32(vreinterpret_u32_s64(d1s64), d10u32);

+    return vget_lane_u32(d0u32, 0);

+}

+unsigned int vp8_variance_halfpixvar16x16_hv_neon(

+        const unsigned char *src_ptr,

+        int  source_stride,

+        const unsigned char *ref_ptr,

+        int  recon_stride,

+        unsigned int *sse) {

+    int i;

+    uint8x8_t d0u8, d1u8, d2u8, d3u8, d4u8, d5u8, d6u8, d7u8;

+    int16x4_t d0s16, d1s16, d2s16, d3s16, d10s16, d11s16, d12s16, d13s16;

+    int16x4_t d18s16, d19s16, d20s16, d21s16, d22s16, d23s16, d24s16, d25s16;

+    uint32x2_t d0u32, d10u32;

+    int64_t d0s64, d1s64, d2s64, d3s64;

+    uint8x16_t q0u8, q1u8, q2u8, q3u8, q4u8, q5u8, q6u8, q7u8, q8u8, q9u8;

+    uint16x8_t q0u16, q1u16, q5u16, q6u16, q9u16, q10u16, q11u16, q12u16;

+    int32x4_t q13s32, q14s32, q15s32;

+    int64x2_t q0s64, q1s64, q5s64;

+    q13s32 = vdupq_n_s32(0);

+    q14s32 = vdupq_n_s32(0);

+    q15s32 = vdupq_n_s32(0);

+    q0u8 = vld1q_u8(src_ptr);

+    q1u8 = vld1q_u8(src_ptr + 16);

+    src_ptr += source_stride;

+    q1u8 = vextq_u8(q0u8, q1u8, 1);

+    q0u8 = vrhaddq_u8(q0u8, q1u8);

+    for (i = 0; i < 4; i++) {  // vp8_filt_fpo16x16s_4_0_loop_neon

+        q2u8 = vld1q_u8(src_ptr);

+        q3u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q4u8 = vld1q_u8(src_ptr);

+        q5u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q6u8 = vld1q_u8(src_ptr);

+        q7u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q8u8 = vld1q_u8(src_ptr);

+        q9u8 = vld1q_u8(src_ptr + 16);

+        src_ptr += source_stride;

+        q3u8 = vextq_u8(q2u8, q3u8, 1);

+        q5u8 = vextq_u8(q4u8, q5u8, 1);

+        q7u8 = vextq_u8(q6u8, q7u8, 1);

+        q9u8 = vextq_u8(q8u8, q9u8, 1);

+        q1u8 = vrhaddq_u8(q2u8, q3u8);

+        q2u8 = vrhaddq_u8(q4u8, q5u8);

+        q3u8 = vrhaddq_u8(q6u8, q7u8);

+        q4u8 = vrhaddq_u8(q8u8, q9u8);

+        q0u8 = vrhaddq_u8(q0u8, q1u8);

+        q1u8 = vrhaddq_u8(q1u8, q2u8);

+        q2u8 = vrhaddq_u8(q2u8, q3u8);

+        q3u8 = vrhaddq_u8(q3u8, q4u8);

+        q5u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q6u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q7u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        q8u8 = vld1q_u8(ref_ptr);

+        ref_ptr += recon_stride;

+        d0u8 = vget_low_u8(q0u8);

+        d1u8 = vget_high_u8(q0u8);

+        d2u8 = vget_low_u8(q1u8);

+        d3u8 = vget_high_u8(q1u8);

+        d4u8 = vget_low_u8(q2u8);

+        d5u8 = vget_high_u8(q2u8);

+        d6u8 = vget_low_u8(q3u8);

+        d7u8 = vget_high_u8(q3u8);

+        q9u16  = vsubl_u8(d0u8, vget_low_u8(q5u8));

+        q10u16 = vsubl_u8(d1u8, vget_high_u8(q5u8));

+        q11u16 = vsubl_u8(d2u8, vget_low_u8(q6u8));

+        q12u16 = vsubl_u8(d3u8, vget_high_u8(q6u8));

+        q0u16  = vsubl_u8(d4u8, vget_low_u8(q7u8));

+        q1u16  = vsubl_u8(d5u8, vget_high_u8(q7u8));

+        q5u16  = vsubl_u8(d6u8, vget_low_u8(q8u8));

+        q6u16  = vsubl_u8(d7u8, vget_high_u8(q8u8));

+        d18s16 = vreinterpret_s16_u16(vget_low_u16(q9u16));

+        d19s16 = vreinterpret_s16_u16(vget_high_u16(q9u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q9u16));

+        q14s32 = vmlal_s16(q14s32, d18s16, d18s16);

+        q15s32 = vmlal_s16(q15s32, d19s16, d19s16);

+        d20s16 = vreinterpret_s16_u16(vget_low_u16(q10u16));

+        d21s16 = vreinterpret_s16_u16(vget_high_u16(q10u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q10u16));

+        q14s32 = vmlal_s16(q14s32, d20s16, d20s16);

+        q15s32 = vmlal_s16(q15s32, d21s16, d21s16);

+        d22s16 = vreinterpret_s16_u16(vget_low_u16(q11u16));

+        d23s16 = vreinterpret_s16_u16(vget_high_u16(q11u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q11u16));

+        q14s32 = vmlal_s16(q14s32, d22s16, d22s16);

+        q15s32 = vmlal_s16(q15s32, d23s16, d23s16);

+        d24s16 = vreinterpret_s16_u16(vget_low_u16(q12u16));

+        d25s16 = vreinterpret_s16_u16(vget_high_u16(q12u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q12u16));

+        q14s32 = vmlal_s16(q14s32, d24s16, d24s16);

+        q15s32 = vmlal_s16(q15s32, d25s16, d25s16);

+        d0s16 = vreinterpret_s16_u16(vget_low_u16(q0u16));

+        d1s16 = vreinterpret_s16_u16(vget_high_u16(q0u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q0u16));

+        q14s32 = vmlal_s16(q14s32, d0s16, d0s16);

+        q15s32 = vmlal_s16(q15s32, d1s16, d1s16);

+        d2s16 = vreinterpret_s16_u16(vget_low_u16(q1u16));

+        d3s16 = vreinterpret_s16_u16(vget_high_u16(q1u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q1u16));

+        q14s32 = vmlal_s16(q14s32, d2s16, d2s16);

+        q15s32 = vmlal_s16(q15s32, d3s16, d3s16);

+        d10s16 = vreinterpret_s16_u16(vget_low_u16(q5u16));

+        d11s16 = vreinterpret_s16_u16(vget_high_u16(q5u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q5u16));

+        q14s32 = vmlal_s16(q14s32, d10s16, d10s16);

+        q15s32 = vmlal_s16(q15s32, d11s16, d11s16);

+        d12s16 = vreinterpret_s16_u16(vget_low_u16(q6u16));

+        d13s16 = vreinterpret_s16_u16(vget_high_u16(q6u16));

+        q13s32 = vpadalq_s16(q13s32, vreinterpretq_s16_u16(q6u16));

+        q14s32 = vmlal_s16(q14s32, d12s16, d12s16);

+        q15s32 = vmlal_s16(q15s32, d13s16, d13s16);

+        q0u8 = q4u8;

+    }

+    q15s32 = vaddq_s32(q14s32, q15s32);

+    q0s64 = vpaddlq_s32(q13s32);

+    q1s64 = vpaddlq_s32(q15s32);

+    d0s64 = vget_low_s64(q0s64);

+    d1s64 = vget_high_s64(q0s64);

+    d2s64 = vget_low_s64(q1s64);

+    d3s64 = vget_high_s64(q1s64);

+    d0s64 = vadd_s64(d0s64, d1s64);

+    d1s64 = vadd_s64(d2s64, d3s64);

+    q5s64 = vmull_s32(vreinterpret_s32_s64(d0s64),

+                      vreinterpret_s32_s64(d0s64));

+    vst1_lane_u32((uint32_t *)sse, vreinterpret_u32_s64(d1s64), 0);

+    d10u32 = vshr_n_u32(vreinterpret_u32_s64(vget_low_s64(q5s64)), 8);

+    d0u32 = vsub_u32(vreinterpret_u32_s64(d1s64), d10u32);

+    return vget_lane_u32(d0u32, 0);

+}

+enum { kWidth8 = 8 };

+enum { kHeight8 = 8 };

+enum { kHeight8PlusOne = 9 };

+enum { kPixelStepOne = 1 };

+enum { kAlign16 = 16 };

+#define FILTER_BITS 7

+static INLINE int horizontal_add_s16x8(const int16x8_t v_16x8) {

+  const int32x4_t a = vpaddlq_s16(v_16x8);

+  const int64x2_t b = vpaddlq_s32(a);

+  const int32x2_t c = vadd_s32(vreinterpret_s32_s64(vget_low_s64(b)),

+                               vreinterpret_s32_s64(vget_high_s64(b)));

+  return vget_lane_s32(c, 0);

+}

+static INLINE int horizontal_add_s32x4(const int32x4_t v_32x4) {

+  const int64x2_t b = vpaddlq_s32(v_32x4);

+  const int32x2_t c = vadd_s32(vreinterpret_s32_s64(vget_low_s64(b)),

+                               vreinterpret_s32_s64(vget_high_s64(b)));

+  return vget_lane_s32(c, 0);

+}

+static void variance_neon_w8(const uint8_t *a, int a_stride,

+                             const uint8_t *b, int b_stride,

+                             int w, int h, unsigned int *sse, int *sum) {

+  int i, j;

+  int16x8_t v_sum = vdupq_n_s16(0);

+  int32x4_t v_sse_lo = vdupq_n_s32(0);

+  int32x4_t v_sse_hi = vdupq_n_s32(0);

+  for (i = 0; i < h; ++i) {

+    for (j = 0; j < w; j += 8) {

+      const uint8x8_t v_a = vld1_u8(&a[j]);

+      const uint8x8_t v_b = vld1_u8(&b[j]);

+      const uint16x8_t v_diff = vsubl_u8(v_a, v_b);

+      const int16x8_t sv_diff = vreinterpretq_s16_u16(v_diff);

+      v_sum = vaddq_s16(v_sum, sv_diff);

+      v_sse_lo = vmlal_s16(v_sse_lo,

+                           vget_low_s16(sv_diff),

+                           vget_low_s16(sv_diff));

+      v_sse_hi = vmlal_s16(v_sse_hi,

+                           vget_high_s16(sv_diff),

+                           vget_high_s16(sv_diff));

+    }

+    a += a_stride;

+    b += b_stride;

+  }

+  *sum = horizontal_add_s16x8(v_sum);

+  *sse = (unsigned int)horizontal_add_s32x4(vaddq_s32(v_sse_lo, v_sse_hi));

+}

+static unsigned int variance8x8_neon(const uint8_t *a, int a_stride,

+                                     const uint8_t *b, int b_stride,

+                                     unsigned int *sse) {

+  int sum;

+  variance_neon_w8(a, a_stride, b, b_stride, kWidth8, kHeight8, sse, &sum);

+  return *sse - (((int64_t)sum * sum) / (kWidth8 * kHeight8));

+}

+static void var_filter_block2d_bil_w8(const uint8_t *src_ptr,

+                                      uint8_t *output_ptr,

+                                      unsigned int src_pixels_per_line,

+                                      int pixel_step,

+                                      unsigned int output_height,

+                                      unsigned int output_width,

+                                      const uint16_t *vpx_filter) {

+  const uint8x8_t f0 = vmov_n_u8((uint8_t)vpx_filter[0]);

+  const uint8x8_t f1 = vmov_n_u8((uint8_t)vpx_filter[1]);

+  unsigned int i;

+  for (i = 0; i < output_height; ++i) {

+    const uint8x8_t src_0 = vld1_u8(&src_ptr[0]);

+    const uint8x8_t src_1 = vld1_u8(&src_ptr[pixel_step]);

+    const uint16x8_t a = vmull_u8(src_0, f0);

+    const uint16x8_t b = vmlal_u8(a, src_1, f1);

+    const uint8x8_t out = vrshrn_n_u16(b, FILTER_BITS);

+    vst1_u8(&output_ptr[0], out);

+    // Next row...

+    src_ptr += src_pixels_per_line;

+    output_ptr += output_width;

+  }

+}

+unsigned int vp8_sub_pixel_variance8x8_neon(

+        const unsigned char *src,

+        int src_stride,

+        int xoffset,

+        int yoffset,

+        const unsigned char *dst,

+        int dst_stride,

+        unsigned int *sse) {

+  DECLARE_ALIGNED_ARRAY(kAlign16, uint8_t, temp2, kHeight8 * kWidth8);

+  DECLARE_ALIGNED_ARRAY(kAlign16, uint8_t, fdata3, kHeight8PlusOne * kWidth8);

+  if (xoffset == 0) {

+    var_filter_block2d_bil_w8(src, temp2, src_stride, kWidth8, kHeight8,

+                              kWidth8, bilinear_taps_coeff[yoffset]);

+  } else if (yoffset == 0) {

+    var_filter_block2d_bil_w8(src, temp2, src_stride, kPixelStepOne,

+                              kHeight8PlusOne, kWidth8,

+                              bilinear_taps_coeff[xoffset]);

+  } else {

+    var_filter_block2d_bil_w8(src, fdata3, src_stride, kPixelStepOne,

+                              kHeight8PlusOne, kWidth8,

+                              bilinear_taps_coeff[xoffset]);

+    var_filter_block2d_bil_w8(fdata3, temp2, kWidth8, kWidth8, kHeight8,

+                              kWidth8, bilinear_taps_coeff[yoffset]);

+  }

+  return variance8x8_neon(temp2, kWidth8, dst, dst_stride, sse);

+}

--- a/vp8/vp8_common.mk

+++ b/vp8/vp8_common.mk

@@ -160,9 +160,6 @@

 VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/loopfiltersimpleverticaledge_neon$(ASM)

 #VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/buildintrapredictorsmby_neon$(ASM)

 VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/idct_blk_neon.c

-VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/vp8_subpixelvariance8x8_neon$(ASM)

-VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/vp8_subpixelvariance16x16_neon$(ASM)

-VP8_COMMON_SRCS-$(HAVE_NEON_ASM)  += common/arm/neon/vp8_subpixelvariance16x16s_neon$(ASM)

 # common (neon intrinsics)

 VP8_COMMON_SRCS-$(HAVE_NEON)  += common/arm/neon/bilinearpredict_neon.c

@@ -180,5 +177,6 @@

 VP8_COMMON_SRCS-$(HAVE_NEON)  += common/arm/neon/sixtappredict_neon.c

 VP8_COMMON_SRCS-$(HAVE_NEON)  += common/arm/neon/idct_dequant_0_2x_neon.c

 VP8_COMMON_SRCS-$(HAVE_NEON)  += common/arm/neon/variance_neon.c

+VP8_COMMON_SRCS-$(HAVE_NEON)  += common/arm/neon/vp8_subpixelvariance_neon.c

 $(eval $(call rtcd_h_template,vp8_rtcd,vp8/common/rtcd_defs.pl))