Den som hamnar utanför indexet förlorar inte mot konkurrenten — hen är inte ens med i loppet. Den här artikeln visar varför upptäckt, crawl och indexering är tre skilda steg, vad Indexing Hub i Semalt-panelet gör mätbart av dem, och vilka gränser verktyget medvetet sätter.
Nästan varje SEO-plan börjar med texter, sökord och länkar. Det är begripligt, för där är arbetet synligt och går att diskutera. Steget innan förblir däremot oomtalat: känner sökmotorn över huvud taget till din sida, och har den bestämt sig för att spara den? Så länge det står öppet arbetar du på något vars existens sökmotorn inte har erkänt.
Det är inte heller bara de stora portalernas problem. En evenemangsplattform i Stockholm med tusentals enskilda föreställningar, en webbshop inom design med ett brett sortiment, ett life science-bolag med tvåspråkig dokumentation: i samtliga fall tillkommer adresser i en takt som ingen längre följer manuellt. Att det finns en eftersläpning upptäcks typiskt först när den organiska trafiken står still medan redaktionen publicerar varje vecka.
Tre steg som ofta förväxlas med ett
Det mest långlivade tankefelet behandlar indexering som en enda händelse som antingen inträffar eller inte. I själva verket rör det sig om tre steg i följd, vart och ett med sin egen logik och sin egen typ av blockering. Ett problem som uppstår i det första steget går inte att reparera i det tredje, hur många inskickningar man än kastar på det.
- Upptäckt. Sökmotorn får veta att en adress finns — via interna hänvisningar, en sitemap, en extern länk eller ett aktivt meddelande. Utan en väg dit existerar sidan inte i dess världsbild.
- Crawl. Boten hämtar faktiskt adressen. Hur många hämtningar din domän får inom en period kallas crawlbudget och följer av serverprestanda, tidigare svarskvalitet och den uppskattade nyttan av domänen.
- Indexering. Den hämtade sidan bedöms och sparas — eller just inte. Det beslutet handlar om innehåll, dubbletter och signaler som antingen pekar åt samma håll eller motsäger varandra.
Det kan gå veckor mellan de tre handlingarna. En adress kan ha varit känd i månader utan att någonsin ha hämtats; en adress kan vara hämtad och ändå avvisad. Den som håller fast vid den distinktionen ställer den enda fråga som leder vidare: vid vilket steg stannar det upp? En bredare överblick över alla moduler finns i beskrivningen av den förnyade Semalt-panelen; här handlar det uteslutande om indexeringsdelen.
| Det du observerar | Steg där det går fel | Vad du gör |
|---|---|---|
| Ingen bot har någonsin besökt URL:en | Upptäckt | Skapa en intern länk, utöka sitemappen, skicka ett aktivt meddelande |
| Besök registrerat, men med ett serverfel | Crawl | Gå igenom infrastruktur och svarstider under belastning |
| Besöket lyckades, sidan hålls utanför indexet | Indexering | Få innehåll, canonical och interna signaler att peka åt samma håll |
| Bara de djupa sidorna släpar efter | Upptäckt och crawl | Minska klickdjupet, städa i paginering och filter |
| Nya sidor dyker upp först efter veckor | Upptäckt | Använd aktivt meddelande i stället för att vänta på ett rutinbesök |
Sex orsaker som återkommer
Vid genomgångar återkommer samma orsaker med en förutsägbarhet som gränsar till det komiska. De sex nedan täcker den klart största delen av fallen, ordnade efter det steg de uppstår i.
| Orsak | Steg | Så känner du igen den | Vad som löser den |
|---|---|---|---|
| Föräldralös sida utan ingående länkar | Upptäckt | Svarar med status 200, finns i ingen sitemap och ingen navigation | Ta in den i en relevant rubrik och i sitemappen |
| För stort klickdjup | Upptäckt | Tolv klick från startsidan, nåbar bara via paginering | Plattare struktur, hubbsidor, bättre intern länkning |
| Dubblettinnehåll från parametrar | Indexering | Samma artikel via tre vägar, med sorterings- och filtervarianter | Välj en canonical och använd den konsekvent |
| Motstridiga canonicals | Indexering | Pagineringen pekar på sida ett, målen omdirigerar eller saknas | Låt canonical peka på en befintlig, indexerbar URL |
| robots.txt förväxlad med noindex | Crawl | Blockerad URL blir kvar i indexet, eftersom noindex inte kan läsas | Öppna åtkomsten och låt noindex bli läst |
| Långsam eller instabil leverans | Crawl | Svarstider stiger under belastning, 5xx-fel vid toppar | Få cachning, drift och felhantering på plats |
Två av de sex förtjänar en varning för sig. Förväxlingen mellan robots.txt och noindex kostar veckor vid varje lansering: en blockerad adress läses inte, och därmed inte heller instruktionen inuti den. Och en canonical är en rekommendation, inte en order; sökmotorn får välja en annan variant än den du tänkt dig.
Sverige lägger en egen skärpning ovanpå. Ett bolag som publicerar sitt erbjudande på både svenska och engelska — och det är här snarare regel än undantag — fördubblar sitt bestånd av adresser. Crawlbudgeten fördubblas inte i motsvarande grad. När det svenska språkområdet dessutom är litet betyder det att hälften av beståndet slåss om uppmärksamhet på en marknad där den engelska versionen kanske inte alls är den som ska prioriteras. Den som förvaltar stora mängder utan koll på svarstiderna börjar därför inte vid inskickningen utan vid den tekniska grunden.
Indexing Hub: gränserna är designade
Tre funktioner ligger samlade i Indexing Hub: att anmäla adresser, att läsa sitemaps och att registrera vad botarna sedan gör med dem. Det mest användbara är inte möjligheterna utan begränsningarna, för de avgör vad som är uppnåeligt inom vilken tidshorisont.
Det minsta talet är det mest intressanta. Tusen adresser om dagen räcker gott och väl för en företagswebbplats på sjuttio sidor, men vid en katalog med tiotusentals adresser blir det en knapp resurs som kräver fördelning — precis som en mediebudget. Just där ligger vinsten med gränsen: den framtvingar ett val som annars skjuts upp i det oändliga.
Massinskickning av adresser
För de tillfällen då många URL:er ändras samtidigt: en migrering, en omdesign, en ny säsong.
- En försändelse, inga portioner. Hela listan iväg på en gång; uppdelningen i hanterbara bitar faller bort.
- Dygnsbudgeten är fortfarande bromsen. Tiotusen adresser levererade på en gång ger ändå tio dagars behandling. Batchens storlek ändrar alltså inte genomloppstiden.
- Sorteringen är det egentliga beslutet. Vid en snäv budget är ordningen det enda du fortfarande styr, och den avgör utbytet under vecka ett.
- För undantag, inte för rutinen. Publiceringstakten på en normal webbplats kommer aldrig i närheten av den här gränsen.
Sitemapbehandling
För samlingar som redan är organiserade i sitemapindex, till exempel per språk eller per kategori.
- Uppladdning eller hänvisning. Både en uppladdad fil och en offentlig adress accepteras, så du kan räkna igenom en uppsättning innan den går live.
- Kedjor tre lager djupt. Pekar ett index på ännu ett index vecklas kedjan ut i tre lager. Den som nästlar djupare gör klokt i att platta till strukturen.
- Tusen filer i ett jobb. Därmed täcker en enda omgång hela uppdelningen av en stor webbplats efter språk, rubrik eller innehållstyp.
- Två åt gången, tjugo i väntan. Gott om utrymme för en byrå med en handfull kunder i Mälardalen, förutsatt att någon håller ordning på kön: fredagens lansering ska ligga före rutinunderhållet.
Båda ingångarna mynnar ut i samma registrering och delar samma dygnsbudget. Hur indexeringsmodulen hos Semalt förhåller sig till analys- och kampanjdelarna beskrivs i plattformsöversikten.
Att knuffa i stället för att vänta
Traditionellt hämtar sökmotorn när det passar den. På en domän med låg aktivitet kan en djup sida vänta veckor på det, och vid en prisändring eller en anmälningsfrist är det precis de veckorna som räknas. IndexNow-kopplingen vänder på riktningen: webbplatsen skickar själv en signal till GoogleBot och BingBot så snart något har ändrats.
Vid ändringar ger det framför allt genomloppstid. En rättad beskrivning, ett nytt pris, ett öppnat program eller en återöppnad rubrik behöver inte vänta på att någon råkar komma förbi. För allt som hänger på en kalender — evenemang, besöksnäring, restaurang, säsongsvaror — avgör det om du syns medan efterfrågan finns eller först efteråt.
Det som däremot ändras är frågan du kan ställa. Inte längre: känner sökmotorn ens till den här sidan? Utan: den känner till den, den har hämtat den, och ändå står den inte där — vad håller den tillbaka? Det sista går att utreda.
Innehåll som just ändrats
Ett nytt pris, en ändrad öppettid, en uppdaterad beskrivning: här räknas varje dag du är snabbare ute.
- Erbjudanden med ett slutdatum
- Sidor som bär säsongen
Adresser som just blivit tillgängliga
En upphävd blockering, en borttagen noindex eller en ny rubrik som ännu inte länkas från något håll.
- Efter en lansering eller migrering
- Efter en reparation av robots.txt
Sidor som inte ändrats
Att anmäla igen utan ändring kostar dygnsbudget och ger ingenting. Sökmotorn har redan bildat sig en uppfattning.
- Upprepning påskyndar inget beslut
Sidor som blir avvisade
Tunt innehåll, en dubblett eller en motstridig canonical blir inte mer acceptabel av ett meddelande.
- Först orsaken, sedan inskickningen
Från förmodan till statuskod
Det är inte utskicket utan registreringen som gör modulen användbar. För varje adress noteras när en bot kom förbi, vilken status den mötte och vilken feldetalj som hörde till. Bredvid löper tre räknare — inskickade, hittade, misslyckade — som rör sig redan medan ett jobb pågår, så att du inte sitter och väntar i blindo.
De tre uppgifterna fungerar bara tillsammans. Tidpunkten visar om något över huvud taget hämtats; statusen avslöjar om du står inför en teknisk fråga eller en innehållsfråga; och feldetaljen pekar ut var reparationen ska ske. Därmed tar en diskussion slut som i många projekt kan dra ut i åratal — att Google av outgrundliga skäl skulle hålla en viss sida ute — och i stället börjar en uppgiftslista med ägare.
- Anmäld, aldrig hämtad. Räknaren registrerar inskickningen, loggen förblir tom. Titta då på robots.txt, på serverns belastning och på en möjlig inbromsning av hela domänen.
- Hämtad, men servern föll ihop. En 5xx under besöket är sällan ett problem med just den sidan; det pressar genomloppet för hela domänen.
- Hämtad, men det stod ingenting. Status 404 eller 410 pekar på en föråldrad rad i sitemappen eller en hänvisning till raderat innehåll. Då ska den tas bort, inte skickas igen.
- Hämtad, men omdirigerad. Du har anmält en mellanstation i stället för slutmålet. Anmäl hädanefter den slutliga adressen.
- Hämtad, läst, avvisad. Tekniskt är allt i sin ordning. Orsaken ligger då i innehållet, i den kanoniska hänvisningen eller i saknade interna länkar.
Fyrtiotusen adresser vid tusen om dagen
Räkneexemplet nedan ska göra storleksordningen kännbar; det är uttryckligen ingen mätning på ett befintligt projekt.
En handelsplattform i Stockholm har 40 000 adresser i sina sitemaps, svenska och engelska versioner sammanlagt. Med 1 000 adresser om dagen tar en komplett omgång fyrtio dagar, och det talet gäller bara vid fullt utnyttjad budget utan en enda upprepning. Lägg till korrigeringsomgångarna och du är uppe i sex till åtta veckor. En batchstorlek på tiotusen ändrar ingenting på den punkten; den tar bara bort klipp-och-klistra-arbetet.
Sex veckor är för lång tid för ett erbjudande med ett utgångsdatum. Det talar inte emot verktyget utan för att sortera. En trolig uppdelning av samma fyrtiotusen ser ut så här.
- Omkring 14 500 filter- och parametervarianter. Sorteringar, prisintervall, sessionsparametrar. Det är en canonical-fråga; förbrukad budget: noll.
- Omkring 9 200 utgångna poster. Passerade datum, utgångna varor. De kräver en omdirigering eller en prydlig 410, inte en inskickning.
- Omkring 260 rubrik- och landningssidor. De bär merparten av omsättningen och kan vara på plats på en fjärdedel av en dygnsbudget.
- Omkring 4 400 aktuella erbjudandesidor på båda språken. De följer på fyra till fem dagar och täcker den löpande handeln.
- Omkring 11 640 arkiv- och långsvanssidor. De rullar därefter med i bakgrunden, utan frist och utan press.
Det som såg ut som fyrtio dagar krymper därmed till fem dagar för allt som ger pengar. Vinsten kommer ur sorteringen och inte ur tekniken. För en tvåspråkig svensk webbplats tillkommer ett kriterium: bestäm uttryckligen vilken språkversion som går först. Eftersom den svenska volymen redan från början är låg är frestelsen stor att prioritera den engelska versionen efter råa tal — men de engelska sidorna konkurrerar mot ett betydligt bredare fält, och en saknad svensk sida med tydlig köpavsikt kostar mer än totalen antyder. Synlighetsrapporterna på samma plattform ligger i samma konto, så den kontrollen behöver inte sättas upp separat.
Sitemaphygien och en användbar arbetsordning
En sitemap är ingen lagerlista utan en inställning: med varje rad säger du att just den här sidan är värd att spara. Består en fjärdedel av filen av omdirigeringar, felsidor och adresser med noindex sjunker trovärdigheten för alltihop — även för de rader som med full rätt står där.
Indexerbara slutmål
Bara kanoniska adresser med status 200, skrivna exakt som de står i sin slutliga form.
- Sanningsenlig lastmod, ingen nattlig uppfräschning
- Egna filer per språk och per innehållstyp
- Ett överordnat index som håller sig inom tre lager
Allt som ändå avvisas
Varje adress som sökmotorn under alla omständigheter avvisar försvagar filens utsaga.
- Noindex, blockerade adresser, omdirigeringar
- Filtrerade varianter och interna sökresultat
- Varukorg, kundzon, testservrar, felsidor
Arbetsordningen börjar därför med städning och inte med utskick. Sanera först filerna och låt dem sedan läsas in, som uppladdning eller som hänvisning, beroende på om de redan ligger offentligt. Det som kommer tillbaka är en nollmätning: hur många adresser som hittades, hur många som föll bort och vilka statuskoder som hopar sig.
Den fellistan städar du i innan en enda dygnsbudget går åt till den. Först därefter skickas den sorterade listan iväg, med de bärande sidorna överst. En vecka senare innehåller loggen material nog för tre högar: hämtad och sparad, hämtad och avvisad, samt aldrig besökt. Den sista högen är tekniskt arbete, den mellersta redaktionellt.
Vanliga frågor
Hur lång tid tar det innan en inskickad adress står i indexet?
Det finns ingen fast frist, och varje siffra du läser någonstans är en uppskattning. Det du däremot förkortar är vägen till upptäckt och till den första hämtningen. Själva upptagningen förblir sökmotorns beslut. Loggen visar under alla omständigheter om hämtningen har ägt rum, och därmed har du redan halva svaret.
Räcker tusen adresser om dagen för en medelstor webbshop?
För den dagliga takten nästan alltid. Även ett intensivt publiceringsschema håller sig långt under tusen ändrade adresser per dygn. Trångt blir det vid en första fullständig genomräkning, vid en omdesign eller vid en migrering — just de tillfällen då försortering lönar sig, eftersom den kommersiellt bärande delen av en katalog som regel är liten.
Hur angriper man en webbplats som betjänar både svenska och engelska?
Båda versionerna är självständiga adresser och drar båda på samma dygnsbudget. Lägg filerna åtskilda per språk under ett överordnat index — den kedjan vecklas ut utan besvär — och bestäm därefter vilket språk som har företräde. Språkregistrering ligger inte i verktyget; det valet kommer ur din egen struktur och dina prioriteringar.
Vad händer om jag skickar in samma adress flera gånger?
Då går budget åt till ingenting. En sida som inte har ändrats bedöms inte snabbare av en upprepning. En ny anmälan lönar sig först efter en verklig ändring: annat innehåll, en rättad canonical eller en blockering du just tagit bort.
Varför står det sidor i indexet som jag just ville utesluta?
Nästan alltid på grund av förväxlingen mellan robots.txt och noindex. En adress som är blockerad via robots.txt hämtas inte, så den noindex som står i den blir aldrig läst — och sidan kan på grundval av externa hänvisningar bli kvar i indexet. Öppna åtkomsten, låt noindex bli läst, och blockera först därefter igen om det fortfarande behövs.
Där synlighet faktiskt börjar
Indexering är en underskattad flaskhals därför att den aldrig anmäler sig som en driftstörning. Inget larm går, ingen stapel blir röd; det finns bara sidor som får noll visningar. Den som inte mäter det kan lägga månader på texter och länkar medan blockeringen sitter ett steg tidigare.
Indexing Hub löser det inte med ett enda tryck. Modulen ställer upp tre saker bredvid varandra som var för sig betyder lite: en genomloppsgräns som tvingar fram ett val, en signal som förkortar vägen till upptäckt, och en registrering som ersätter gissningar med tidpunkter och statuskoder. Begränsningarna hör till bilden — tusen adresser per dygn är ändligt, två parallella jobb likaså, och ett meddelande förblir ett meddelande.
Just den nyktra hållningen gör arbetet planerbart. Den som har på papper att fyrtiotusen adresser vid full budget kräver fyrtio dagar ingår andra överenskommelser än den som trycker på skicka och hoppas på det bästa. Vill du veta hur många av dina egna sidor som faktiskt hämtas, börja med en sitemapomgång via Semalt-panelen och ditt första indexeringsjobb. Den första statusbilden är som regel mer lärorik än väntat — och på tvåspråkiga svenska webbplatser ligger den största överraskningen nästan alltid i den språkversion ingen tittade på.