Test A/B en Amazon: la regla de las 1.000 visitas no es suya
R
RenéFreelance Amazon Editor
|
11 min read
Pregunta por qué tu ASIN no aparece en Manage Your Experiments y te dirán que necesita 1.000 visitas a la página de producto en los últimos 30 días. Ese número está en todas partes, los vendedores discuten sobre él en el propio foro de Amazon, y no aparece en ninguna parte de la documentación de Amazon. Lo que Amazon publica es otra medida en otra unidad, y esa brecha explica la mayor parte de la confusión en torno a una herramienta que por lo demás es el único retorno honesto que recibe un listing.
Manage Your Experiments es la herramienta de test A/B integrada de Amazon para vendedores registrados en Brand Registry. Divide a los compradores en dos grupos, muestra a cada grupo una versión distinta del título, las imágenes, los puntos destacados, la descripción, el contenido A plus o la Brand Story, e informa de cuál funcionó mejor. Amazon no publica un umbral de visitas. Dice que un ASIN necesita suficiente tráfico en las últimas semanas, lo que en la mayoría de categorías significa varias decenas de pedidos por semana o más.
¿De dónde sale el número 1.000?
De un vendedor, en un hilo del foro, describiendo lo que creía que era la regla. El hilo empieza así: "Right now, Amazon requires an ASIN to have at least 1,000 detail page views in the last 30 days before you can run an experiment." Es una queja razonable, bien argumentada, y nombra tres síntomas reales que reconocerá cualquiera que use la herramienta.
"The weekly refresh makes eligibility inconsistent, so an ASIN might qualify one week and drop below the next."
"Page view numbers don't match between Manage Your Experiments and Business Reports, which makes it hard to know what to rely on."
"Newer or niche products are effectively locked out of using one of Amazon's most valuable optimization tools."
Un empleado de Amazon respondió, y la respuesta dice sobre todo lo que calla. Indy_Amazon concede los síntomas por completo: "You're spot on about the challenges. The requirement exists to ensure experiments have enough statistical power to give meaningful results, but I hear you on the inconsistency with weekly refreshes and the discrepancies between different reporting tools." Amazon confirma así la inconsistencia y el desajuste entre informes. No confirma el umbral, pero tampoco lo corrige.
¿Qué publica Amazon en realidad?
Una prueba de tráfico expresada en pedidos, con el reconocimiento explícito de que varía. La página de ayuda de Manage Your Experiments dice: "An ASIN is eligible if it belongs to your brand and has received enough traffic in recent weeks to be eligible for experimentation. We only let you experiment with high-traffic ASINs to increase the likelihood that you can confidently determine a winner at the end of the experiment. Depending on the category, high-traffic ASINs may get several dozen orders per week, or more."
Lo que dicen los vendedores
Lo que dice la página de Amazon
Por qué importa
1.000 visitas a la página de producto
"enough traffic in recent weeks"
No se publica ninguna cifra
Visitas
"several dozen orders per week, or more"
Un ASIN que convierte bien califica con mucho menos tráfico
Un listón fijo
"Depending on the category"
El listón se mueve entre categorías
Mi ASIN sale como no elegible
"ASINs with very low traffic may not appear at all"
La ausencia es un estado, no un fallo
Por qué el cambio de unidad importa más que el número
Un umbral en visitas y otro en pedidos se comportan de forma muy distinta para el mismo producto. Un ASIN que convierte al ocho por ciento necesita una fracción del tráfico de otro que convierte al uno por ciento para llegar al mismo número de pedidos, así que dos listings con visitas idénticas pueden quedar a lados opuestos de la línea. También es una explicación coherente del parpadeo semanal que describen los vendedores: un experimento necesita suficientes conversiones para separar dos versiones, y las conversiones oscilan más que las visitas. El objetivo declarado de Amazon es que puedas "confidently determine a winner", y un ganador se determina en compras.
La corrección es más estrecha de lo que parece y no convierte la queja en errónea. La propia respuesta de Amazon admite que la elegibilidad fluctúa y que sus números no cuadran con los Business Reports, y en un punto contradice a este artículo, cosa que conviene decir sin rodeos: Indy_Amazon recomienda campañas de Sponsored Products "to increase visibility and get those page views up to the threshold". El personal del foro habla por tanto de visitas y trata un umbral como real, mientras que la documentación de Amazon habla de pedidos y no publica ninguna cifra. Ninguno de los dos confirma las 1.000. Lo que cambia es el diagnóstico: un ASIN que convierte bien puede cruzar la línea con mucho menos tráfico del que esperas, así que comprar visitas es un intento razonable y una base pobre.
¿Qué se puede probar, y cómo se reparte?
Seis tipos de contenido, en trece tiendas, un experimento por ASIN a la vez. Amazon enumera "product images, product titles, product bullet points, product description and A+ Content and Brand Story", y el tipo Multi-Attribute permite combinar varios en un solo experimento. La herramienta funciona "in the US, Canada, Mexico, the UK, Germany, France, Spain, Italy, the Netherlands, Poland, Sweden, India, and Japan for selling partners who are registered brand owners enrolled in Amazon Brand registry".
Conviene explicar el mecanismo porque el modelo mental habitual de un test A/B aquí es falso. Amazon no alterna tu contenido en el tiempo: "customers that view your product's content are randomly split into two groups. One group sees Version A of content, while the other sees Version B, for the entire experiment. This means that experiments are not rotating content over time." La versión de prueba sigue al cliente a todas partes, así que un título experimental "will show in search results, on the product detail page, and in cart/checkout". Y una tranquilidad que Amazon deja entre paréntesis: "(Note: Experiments do not impact search rankings)".
Las ideas de prueba de Amazon contradicen el consejo habitual sobre títulos
Su página de consejos sugiere "Reducing product title length to under 100 characters to reduce noise and encourage more customers to visit your detail page". Es una cifra distinta de los límites de caracteres que se aplican al publicar, y se ofrece como hipótesis para probar y no como norma que seguir, que es justo el enfoque correcto. Si venías recortando títulos hasta un límite de política, el experimento interesante es si acortar aún más sigue ayudando. Nuestra guía sobre las reglas de títulos de Amazon explica dónde están los límites duros de verdad.
¿Cuánto dura una prueba?
De ocho a diez semanas por defecto, o cuatro si dejas decidir a Amazon. La documentación es directa: "The duration of the experiment is typically 8-10 weeks. This allows us time to collect as much data as possible." La alternativa es correr hasta la significación en lugar de hasta una fecha, algo que Amazon admite "for title, image, and bullet point experiments" y que se puede combinar con la publicación automática: "Combine Experiment to Significance with Auto-Publish to automatically publish your winning content as soon as your experiment reaches statistical-relevance in as little as 4 weeks."
La impaciencia tiene un coste, y Amazon lo escribe en vez de dejarlo implícito. "Every time you 'peek' at the results before an experiment ends, you increase the chance of making a decision based on unrepresentative results, which reduces the validity of your experiment." La página de consejos lo repite: terminar antes "increases the chance of overestimating the impact of your experiment or even selecting the wrong version". Es un efecto estadístico real y no una preferencia de política, y es la forma más común en que un vendedor convierte una buena prueba en una mala decisión. Las dos páginas de Amazon tampoco coinciden en cada cuánto verías un cambio: la página de resultados dice "Experiment results are updated once a week until the experiment ends", mientras que las FAQ dicen "We calculate experiment results every week or two". Ninguna de las dos resuelve la contradicción, lo que ya es un argumento para no mirar.
¿Cómo se lee el resultado?
Con cuidado, porque dos de las cifras más visibles significan menos de lo que parecen. La probabilidad no es un nivel de confianza en el sentido cotidiano. Amazon la define: "if we say there is a 75% probability that Version A is better, that means that 75% of the possible impacts that we calculated show a likely positive units/sales lift from publishing Version A." Es la proporción de resultados modelados que cae de un lado, lo cual es útil, y no es lo mismo que un setenta y cinco por ciento de probabilidad de que tus ventas suban.
La proyección a un año es una sola multiplicación
Amazon es inusualmente franca aquí: "To project one-year impact, we calculate the average daily sales increase of the winning content and multiply by 365. This is an estimate which doesn't take into account seasonality, price changes, or other factors that would affect your business in the real world." Una prueba que atravesó un pico estacional proyectará ese pico sobre doce meses. La formulación de Amazon, con su etiqueta torcida incluida: "The Likely column shows the median (the 50th percentile) of the range of possible outcomes we calculated. The Best Case and Worse Case columns show the 95% confidence interval of those outcomes." Lee el intervalo, no el titular, y fíjate en la advertencia de Amazon de que para ganadores flojos "the 'worst case' impact may be negative".
Amazon enumera cuatro causas, y la primera es la que se provocan los propios vendedores: "The change you made to your content was too small to significantly change customer behavior". Las demás son tráfico insuficiente, dos versiones "similarly effective in driving sales" y un cambio que "isn't something that most customers care about when making a purchase decision".
Cómo montar un experimento que te diga algo
Comprueba que el ASIN está ahí antes de planificar nada - La elegibilidad la decide Amazon y se actualiza cada semana, y los ASIN con poco tráfico pueden no estar listados. Abre primero el selector. Si el ASIN falta en vez de aparecer marcado como no elegible, ese es el caso de tráfico bajo, y esperar a que suba un contador de visitas no lo cambiará.
Elige un cambio lo bastante grande para detectarse - Dos versiones que se diferencian en una palabra darán un resultado no concluyente tras diez semanas. Amazon pide versiones "very different from each other", por ejemplo un título mucho más corto, una imagen principal realmente distinta o contenido A plus con otros módulos en otro orden.
Elige a conciencia entre duración y significación - Una tanda fija dura normalmente entre ocho y diez semanas. Experiment to Significance, disponible para pruebas de título, imagen y puntos destacados, termina cuando los datos sostienen una decisión y con Auto-Publish puede cerrarse en solo cuatro semanas. Decide al crearla, no a mitad de la prueba.
Para A plus y Brand Story, iguala los conjuntos de ASIN - Amazon se niega a lanzar un experimento en el que las dos versiones estén aplicadas a ASIN distintos: "we require that both versions of content have the exact same ASINs applied before you can submit your experiment". Se arregla en el A+ Content manager, no en la pantalla del experimento.
Y después no lo toques - Los resultados se actualizan aproximadamente cada semana, y mirarlos está documentado como perjudicial para la validez de tu propia prueba. Si no puedes resistirte, usa Auto-Publish para que la decisión dependa de los datos y no de la semana en que te dio por mirar.
Publica el ganador deliberadamente - Sin Auto-Publish no pasa nada por sí solo. Para mantener el contenido existente, no hagas nada. Para publicar la versión experimental, usa las herramientas de listing habituales, o el A+ Content manager para A plus y Brand Story.
Qué hacer con los ASIN que nunca van a calificar
Casi todos los catálogos tienen un puñado de ASIN elegibles y una cola larga que no lo será. La propia sugerencia de Amazon para la cola es probar a mano y vigilar los Business Reports, algo que admite que "is not as clean as a controlled experiment" pero da "directional insights". El mejor uso de los ASIN elegibles es tratarlos como presupuesto de investigación para el resto: lo que gana en tu listing más vendido suele ser el mismo tipo de cambio que gana en los veinte que no se pueden probar. Un hallazgo comprobado sobre tus imágenes o la estructura de tus títulos, aplicado a toda una categoría, vale más que una ranura de prueba gastada en una variante que no ve nadie.
Probar solo compensa si luego ves qué pasó con el margen, porque un título que sube unidades y desplaza la mezcla hacia una variante peor no es una victoria. Tener unidades, comisiones y margen por ASIN en un mismo sitio es lo que convierte el resultado de una prueba en una decisión de negocio, y un panel de análisis para vendedores que siga el beneficio por ASIN te da el número que el experimento no da. Nuestra guía sobre contenido A plus cubre qué poner en las versiones que vas a probar.
¿Hace falta que un ASIN tenga 1.000 visitas para ser elegible?
Amazon nunca ha publicado esa cifra. Su página dice que un ASIN necesita suficiente tráfico en las últimas semanas y que los ASIN de alto tráfico "may get several dozen orders per week, or more", según la categoría.
¿Por qué no encuentro mi ASIN en la herramienta?
Amazon muestra el estado de elegibilidad de la mayoría de ASIN candidatos, pero afirma que "ASINs with very low traffic may not appear at all". Un ASIN ausente es por tanto una señal de tráfico y no un fallo.
¿Los experimentos dañan mi posicionamiento?
No. Amazon indica en su resumen que los experimentos no afectan al posicionamiento en búsqueda, aunque el contenido experimental aparezca en los resultados para el grupo que lo ve.
¿Cuánto debería durar un experimento?
Normalmente de ocho a diez semanas con duración fija. Experiment to Significance termina cuando los resultados son estadísticamente relevantes y, combinado con Auto-Publish, puede cerrarse en solo cuatro semanas.
¿Qué significa realmente una probabilidad del 75%?
Que el 75% de los impactos que Amazon modeló muestran una subida probable de unidades o ventas con esa versión. Es una proporción de resultados modelados, no una promesa sobre tu próximo trimestre.
¿En qué marketplaces está Manage Your Experiments?
En Estados Unidos, Canadá, México, Reino Unido, Alemania, Francia, España, Italia, Países Bajos, Polonia, Suecia, India y Japón, para titulares de marca registrados y responsables de vender la marca.
Stop Juggling Tools. SellerMagnet Combines Everything You Need.