A/B test Amazon: la regola dei 1.000 non è quella di Amazon
R
RenéFreelance Amazon Editor
|
11 min read
Chiedi perché la tua ASIN non compare in Manage Your Experiments e ti sentirai rispondere che le servono 1.000 visualizzazioni della scheda negli ultimi 30 giorni. Quel numero è ovunque, i venditori ci litigano sul forum di Amazon, e nella documentazione di Amazon non compare da nessuna parte. Quello che Amazon pubblica è una misura diversa in un'unità diversa, e quel divario spiega gran parte della confusione su uno strumento che per il resto è l'unico riscontro onesto che una scheda riceva.
Manage Your Experiments è lo strumento di A/B test integrato di Amazon per i venditori registrati a Brand Registry. Divide gli acquirenti in due gruppi, mostra a ciascun gruppo una versione diversa di titolo, immagini, punti elenco, descrizione, contenuti A plus o Brand Story, e riporta quale ha reso di più. Amazon non pubblica una soglia di visualizzazioni. Dice che una ASIN ha bisogno di abbastanza traffico nelle ultime settimane, che in gran parte delle categorie significa diverse decine di ordini a settimana o più.
Da dove arriva il numero 1.000?
Da un venditore, in una discussione sul forum, che descriveva quella che riteneva fosse la regola. La discussione si apre così: "Right now, Amazon requires an ASIN to have at least 1,000 detail page views in the last 30 days before you can run an experiment." È una lamentela ragionevole, ben argomentata, e indica tre sintomi reali che chiunque usi lo strumento riconoscerà.
"The weekly refresh makes eligibility inconsistent, so an ASIN might qualify one week and drop below the next."
"Page view numbers don't match between Manage Your Experiments and Business Reports, which makes it hard to know what to rely on."
"Newer or niche products are effectively locked out of using one of Amazon's most valuable optimization tools."
Un dipendente di Amazon ha risposto, e la risposta dice soprattutto ciò che non dice. Indy_Amazon concede per intero i sintomi: "You're spot on about the challenges. The requirement exists to ensure experiments have enough statistical power to give meaningful results, but I hear you on the inconsistency with weekly refreshes and the discrepancies between different reporting tools." Amazon conferma quindi l'incoerenza e il disallineamento dei report. La soglia non la conferma, ma non la corregge nemmeno.
Che cosa pubblica davvero Amazon?
Un criterio di traffico espresso in ordini, con l'ammissione esplicita che varia. La pagina di aiuto di Manage Your Experiments dice: "An ASIN is eligible if it belongs to your brand and has received enough traffic in recent weeks to be eligible for experimentation. We only let you experiment with high-traffic ASINs to increase the likelihood that you can confidently determine a winner at the end of the experiment. Depending on the category, high-traffic ASINs may get several dozen orders per week, or more."
Cosa dicono i venditori
Cosa dice la pagina di Amazon
Perché conta
1.000 visualizzazioni della scheda
"enough traffic in recent weeks"
Non viene pubblicato alcun numero
Visualizzazioni
"several dozen orders per week, or more"
Una ASIN che converte bene si qualifica con molto meno traffico
Una soglia fissa
"Depending on the category"
La soglia si sposta tra categorie
La mia ASIN risulta non idonea
"ASINs with very low traffic may not appear at all"
L'assenza è uno stato, non un difetto
Perché il cambio di unità conta più del numero
Una soglia in visualizzazioni e una in ordini si comportano in modo molto diverso per lo stesso prodotto. Una ASIN che converte all'otto per cento ha bisogno di una frazione del traffico di una che converte all'uno per cento per raggiungere lo stesso numero di ordini, quindi due schede con visualizzazioni identiche possono stare ai lati opposti della linea. È anche una spiegazione coerente dello sfarfallio settimanale segnalato dai venditori: un esperimento ha bisogno di abbastanza conversioni per separare due versioni, e le conversioni oscillano più delle visualizzazioni. L'obiettivo dichiarato da Amazon è che tu "can confidently determine a winner", e un vincitore si determina in acquisti.
La correzione è più stretta di quanto sembri e non rende sbagliata la lamentela. La risposta di Amazon ammette che l'idoneità oscilla e che i suoi numeri non coincidono con i Business Reports, e su un punto va detto chiaramente che contraddice questo articolo: Indy_Amazon consiglia campagne Sponsored Products "to increase visibility and get those page views up to the threshold". Lo staff del forum parla quindi di visualizzazioni e tratta una soglia come reale, mentre la documentazione di Amazon parla di ordini e non pubblica alcun numero. Nessuno dei due conferma i 1.000. Quello che cambia è la diagnosi: una ASIN che converte bene può superare la linea con molto meno traffico di quanto pensi, quindi comprare visualizzazioni è un tentativo ragionevole e una base fragile.
Cosa si può testare, e come avviene la divisione?
Sei tipi di contenuto, in tredici store, un esperimento per ASIN alla volta. Amazon elenca "product images, product titles, product bullet points, product description and A+ Content and Brand Story", e il tipo Multi-Attribute permette di combinarne diversi in un unico esperimento. Lo strumento è attivo "in the US, Canada, Mexico, the UK, Germany, France, Spain, Italy, the Netherlands, Poland, Sweden, India, and Japan for selling partners who are registered brand owners enrolled in Amazon Brand registry".
Il meccanismo va detto perché il modello mentale più diffuso di A/B test qui è sbagliato. Amazon non alterna i contenuti nel tempo: "customers that view your product's content are randomly split into two groups. One group sees Version A of content, while the other sees Version B, for the entire experiment. This means that experiments are not rotating content over time." La versione di test segue il cliente ovunque, quindi un titolo sperimentale "will show in search results, on the product detail page, and in cart/checkout". E una rassicurazione che Amazon lascia tra parentesi: "(Note: Experiments do not impact search rankings)".
I suggerimenti di Amazon contraddicono il consiglio abituale sui titoli
La sua pagina di consigli propone di "Reducing product title length to under 100 characters to reduce noise and encourage more customers to visit your detail page". È un numero diverso dai limiti di caratteri applicati in fase di inserimento, ed è offerto come ipotesi da testare e non come regola da seguire, che è esattamente l'inquadramento giusto. Se finora hai tagliato i titoli su un limite di policy, l'esperimento interessante è capire se accorciare ancora aiuti. La nostra guida alle regole di Amazon sui titoli spiega dove stanno davvero i limiti rigidi.
Quanto dura un test?
Da otto a dieci settimane di norma, o quattro se lasci decidere Amazon. La documentazione è diretta: "The duration of the experiment is typically 8-10 weeks. This allows us time to collect as much data as possible." L'alternativa è correre fino alla significatività invece che fino a una data, cosa che Amazon supporta "for title, image, and bullet point experiments" e che si può combinare con la pubblicazione automatica: "Combine Experiment to Significance with Auto-Publish to automatically publish your winning content as soon as your experiment reaches statistical-relevance in as little as 4 weeks."
L'impazienza ha un costo, e Amazon lo scrive invece di lasciarlo implicito. "Every time you 'peek' at the results before an experiment ends, you increase the chance of making a decision based on unrepresentative results, which reduces the validity of your experiment." La pagina dei consigli lo ripete: chiudere in anticipo "increases the chance of overestimating the impact of your experiment or even selecting the wrong version". È un effetto statistico reale e non una preferenza di policy, ed è il modo più comune in cui un venditore trasforma un buon test in una decisione sbagliata. Le due pagine di Amazon si contraddicono anche su quanto spesso vedresti un cambiamento: la pagina dei risultati dice "Experiment results are updated once a week until the experiment ends", mentre le FAQ dicono "We calculate experiment results every week or two". Nessuna delle due scioglie la contraddizione, il che è già di per sé un argomento per non guardare.
Come si legge il risultato?
Con attenzione, perché due dei numeri più vistosi significano meno di quanto sembri. La probabilità non è un livello di confidenza nel senso quotidiano. Amazon la definisce: "if we say there is a 75% probability that Version A is better, that means that 75% of the possible impacts that we calculated show a likely positive units/sales lift from publishing Version A." È la quota di esiti modellati che cade da un lato, cosa utile, e non è la stessa cosa di una probabilità del settantacinque per cento che le tue vendite salgano.
La proiezione annuale è una sola moltiplicazione
Su questo Amazon è insolitamente onesta: "To project one-year impact, we calculate the average daily sales increase of the winning content and multiply by 365. This is an estimate which doesn't take into account seasonality, price changes, or other factors that would affect your business in the real world." Un test che ha attraversato un picco stagionale proietterà quel picco su dodici mesi. La formulazione di Amazon, etichetta storta compresa: "The Likely column shows the median (the 50th percentile) of the range of possible outcomes we calculated. The Best Case and Worse Case columns show the 95% confidence interval of those outcomes." Leggi l'intervallo, non il numero in evidenza, e nota l'avvertenza di Amazon che per i vincitori deboli "the 'worst case' impact may be negative".
Amazon elenca quattro cause, e la prima è quella che i venditori si procurano da soli: "The change you made to your content was too small to significantly change customer behavior". Le altre sono traffico insufficiente, due versioni "similarly effective in driving sales" e una modifica che "isn't something that most customers care about when making a purchase decision".
Come condurre un esperimento che dica qualcosa
Controlla che la ASIN ci sia prima di pianificare - L'idoneità la decide Amazon e si aggiorna ogni settimana, e le ASIN con poco traffico possono non essere elencate affatto. Apri prima il selettore. Se la ASIN è assente invece che segnata come non idonea, è il caso del traffico basso, e nessuna attesa davanti a un contatore di visualizzazioni lo cambierà.
Scegli un cambiamento abbastanza grande da essere rilevato - Due versioni che differiscono per una parola daranno un esito inconcludente dopo dieci settimane. Amazon chiede versioni "very different from each other", per esempio un titolo nettamente più corto, un'immagine principale davvero diversa o contenuti A plus con moduli diversi in ordine diverso.
Scegli con intenzione fra durata e significatività - Una corsa a durata fissa dura di norma otto-dieci settimane. Experiment to Significance, disponibile per test su titolo, immagine e punti elenco, finisce quando i dati reggono una decisione e con Auto-Publish può chiudersi in appena quattro settimane. Scegli in fase di creazione, non a metà test.
Per A plus e Brand Story allinea esattamente gli insiemi di ASIN - Amazon rifiuta di avviare un esperimento in cui le due versioni sono applicate a ASIN diverse: "we require that both versions of content have the exact same ASINs applied before you can submit your experiment". Si sistema nell'A+ Content manager, non nella schermata dell'esperimento.
E poi lascialo stare - I risultati si aggiornano all'incirca ogni settimana, e guardarli è documentato come dannoso per la validità del tuo stesso test. Se non resisti, usa Auto-Publish così la decisione dipende dai dati e non dalla settimana in cui ti è venuto da controllare.
Pubblica il vincitore con intenzione - Senza Auto-Publish non succede nulla da solo. Per tenere il contenuto esistente non fare niente. Per pubblicare la versione sperimentale usa gli strumenti di listing abituali, o l'A+ Content manager per A plus e Brand Story.
Cosa fare con le ASIN che non si qualificheranno mai
Quasi tutti i cataloghi hanno una manciata di ASIN idonee e una lunga coda che non lo sarà. Il suggerimento di Amazon per la coda è testare a mano e guardare i Business Reports, cosa che ammette "is not as clean as a controlled experiment" ma dà "directional insights". L'uso migliore delle ASIN idonee è trattarle come budget di ricerca per tutte le altre: ciò che vince sulla tua scheda più venduta è di solito lo stesso tipo di modifica che vince sulle venti che non si possono testare. Una scoperta verificata sulle tue immagini o sulla struttura dei titoli, applicata a un'intera categoria, vale più di uno slot speso su una variante che nessuno vede.
Testare paga solo se poi vedi che cosa è successo al margine, perché un titolo che alza i pezzi e sposta il mix verso una variante meno redditizia non è una vittoria. Tenere pezzi, commissioni e margine per ASIN in un solo posto è ciò che trasforma il risultato di un test in una decisione aziendale, e una dashboard di analisi per venditori che traccia il profitto per ASIN ti dà il numero che l'esperimento non dà. La nostra guida ai contenuti A plus spiega cosa mettere nelle versioni che stai testando.
Servono davvero 1.000 visualizzazioni per essere idonei?
Amazon non ha mai pubblicato quella cifra. La sua pagina dice che una ASIN ha bisogno di abbastanza traffico nelle ultime settimane e che le ASIN ad alto traffico "may get several dozen orders per week, or more", a seconda della categoria.
Perché non trovo la mia ASIN nello strumento?
Amazon mostra lo stato di idoneità per la maggior parte delle ASIN candidate ma precisa che "ASINs with very low traffic may not appear at all". Una ASIN assente è quindi un segnale di traffico e non un guasto.
Gli esperimenti danneggiano il mio posizionamento?
No. Amazon afferma nella panoramica che gli esperimenti non influiscono sul posizionamento nei risultati, anche se il contenuto sperimentale compare nella ricerca per il gruppo che lo vede.
Quanto dovrebbe durare un esperimento?
Di norma otto-dieci settimane a durata fissa. Experiment to Significance termina quando i risultati sono statisticamente rilevanti e, con Auto-Publish, può concludersi in appena quattro settimane.
Che cosa significa davvero una probabilità del 75%?
Che il 75% degli esiti modellati da Amazon mostra un probabile aumento di pezzi o vendite per quella versione. È una quota di esiti modellati, non una promessa sul tuo prossimo trimestre.
In quali marketplace c'è Manage Your Experiments?
Stati Uniti, Canada, Messico, Regno Unito, Germania, Francia, Spagna, Italia, Paesi Bassi, Polonia, Svezia, India e Giappone, per i titolari di marchio registrati e responsabili della vendita del marchio.
Stop Juggling Tools. SellerMagnet Combines Everything You Need.