Den som hamnar utanför indexet förlorar inte mot konkurrenten — hen är inte ens med i loppet. Den här artikeln visar varför upptäckt, crawl och indexering är tre skilda steg, vad Indexing Hub i Semalt-panelet gör mätbart av dem, och vilka gränser verktyget medvetet sätter.

Nästan varje SEO-plan börjar med texter, sökord och länkar. Det är begripligt, för där är arbetet synligt och går att diskutera. Steget innan förblir däremot oomtalat: känner sökmotorn över huvud taget till din sida, och har den bestämt sig för att spara den? Så länge det står öppet arbetar du på något vars existens sökmotorn inte har erkänt.

Det är inte heller bara de stora portalernas problem. En evenemangsplattform i Stockholm med tusentals enskilda föreställningar, en webbshop inom design med ett brett sortiment, ett life science-bolag med tvåspråkig dokumentation: i samtliga fall tillkommer adresser i en takt som ingen längre följer manuellt. Att det finns en eftersläpning upptäcks typiskt först när den organiska trafiken står still medan redaktionen publicerar varje vecka.

Avgränsning. Den här artikeln handlar inte om rankingfaktorer eller innehållsstrategi. Ämnet är teknisk hittbarhet: att känna till, att hämta, att spara — och de instrument som gör de tre stegen synliga.
Grunder · Teknisk SEO

Tre steg som ofta förväxlas med ett

Det mest långlivade tankefelet behandlar indexering som en enda händelse som antingen inträffar eller inte. I själva verket rör det sig om tre steg i följd, vart och ett med sin egen logik och sin egen typ av blockering. Ett problem som uppstår i det första steget går inte att reparera i det tredje, hur många inskickningar man än kastar på det.

  • Upptäckt. Sökmotorn får veta att en adress finns — via interna hänvisningar, en sitemap, en extern länk eller ett aktivt meddelande. Utan en väg dit existerar sidan inte i dess världsbild.
  • Crawl. Boten hämtar faktiskt adressen. Hur många hämtningar din domän får inom en period kallas crawlbudget och följer av serverprestanda, tidigare svarskvalitet och den uppskattade nyttan av domänen.
  • Indexering. Den hämtade sidan bedöms och sparas — eller just inte. Det beslutet handlar om innehåll, dubbletter och signaler som antingen pekar åt samma håll eller motsäger varandra.

Det kan gå veckor mellan de tre handlingarna. En adress kan ha varit känd i månader utan att någonsin ha hämtats; en adress kan vara hämtad och ändå avvisad. Den som håller fast vid den distinktionen ställer den enda fråga som leder vidare: vid vilket steg stannar det upp? En bredare överblick över alla moduler finns i beskrivningen av den förnyade Semalt-panelen; här handlar det uteslutande om indexeringsdelen.

Det du observerarSteg där det går felVad du gör
Ingen bot har någonsin besökt URL:enUpptäcktSkapa en intern länk, utöka sitemappen, skicka ett aktivt meddelande
Besök registrerat, men med ett serverfelCrawlGå igenom infrastruktur och svarstider under belastning
Besöket lyckades, sidan hålls utanför indexetIndexeringFå innehåll, canonical och interna signaler att peka åt samma håll
Bara de djupa sidorna släpar efterUpptäckt och crawlMinska klickdjupet, städa i paginering och filter
Nya sidor dyker upp först efter veckorUpptäcktAnvänd aktivt meddelande i stället för att vänta på ett rutinbesök
Praktiskt råd. Fastställ steget innan du ens rör en knapp i ett inskickningsverktyg. En sida utan någon ingående väg är en strukturfråga; en sida som hämtas prydligt och ändå avvisas är en innehållsfråga. Det är två olika team och två olika kalendrar.
Diagnos · Mönster

Sex orsaker som återkommer

Vid genomgångar återkommer samma orsaker med en förutsägbarhet som gränsar till det komiska. De sex nedan täcker den klart största delen av fallen, ordnade efter det steg de uppstår i.

OrsakStegSå känner du igen denVad som löser den
Föräldralös sida utan ingående länkarUpptäcktSvarar med status 200, finns i ingen sitemap och ingen navigationTa in den i en relevant rubrik och i sitemappen
För stort klickdjupUpptäcktTolv klick från startsidan, nåbar bara via pagineringPlattare struktur, hubbsidor, bättre intern länkning
Dubblettinnehåll från parametrarIndexeringSamma artikel via tre vägar, med sorterings- och filtervarianterVälj en canonical och använd den konsekvent
Motstridiga canonicalsIndexeringPagineringen pekar på sida ett, målen omdirigerar eller saknasLåt canonical peka på en befintlig, indexerbar URL
robots.txt förväxlad med noindexCrawlBlockerad URL blir kvar i indexet, eftersom noindex inte kan läsasÖppna åtkomsten och låt noindex bli läst
Långsam eller instabil leveransCrawlSvarstider stiger under belastning, 5xx-fel vid topparFå cachning, drift och felhantering på plats

Två av de sex förtjänar en varning för sig. Förväxlingen mellan robots.txt och noindex kostar veckor vid varje lansering: en blockerad adress läses inte, och därmed inte heller instruktionen inuti den. Och en canonical är en rekommendation, inte en order; sökmotorn får välja en annan variant än den du tänkt dig.

Sverige lägger en egen skärpning ovanpå. Ett bolag som publicerar sitt erbjudande på både svenska och engelska — och det är här snarare regel än undantag — fördubblar sitt bestånd av adresser. Crawlbudgeten fördubblas inte i motsvarande grad. När det svenska språkområdet dessutom är litet betyder det att hälften av beståndet slåss om uppmärksamhet på en marknad där den engelska versionen kanske inte alls är den som ska prioriteras. Den som förvaltar stora mängder utan koll på svarstiderna börjar därför inte vid inskickningen utan vid den tekniska grunden.

Verktyg · Indexing Hub

Indexing Hub: gränserna är designade

Tre funktioner ligger samlade i Indexing Hub: att anmäla adresser, att läsa sitemaps och att registrera vad botarna sedan gör med dem. Det mest användbara är inte möjligheterna utan begränsningarna, för de avgör vad som är uppnåeligt inom vilken tidshorisont.

1 000
adresser per dygn och konto
10 000
adresser i en batch
3
nivåer djupt uppvecklat
1 000
sitemaps per jobb
2 / 20
parallellt och i kö

Det minsta talet är det mest intressanta. Tusen adresser om dagen räcker gott och väl för en företagswebbplats på sjuttio sidor, men vid en katalog med tiotusentals adresser blir det en knapp resurs som kräver fördelning — precis som en mediebudget. Just där ligger vinsten med gränsen: den framtvingar ett val som annars skjuts upp i det oändliga.

Indexing Hub · ingång 1

Massinskickning av adresser

För de tillfällen då många URL:er ändras samtidigt: en migrering, en omdesign, en ny säsong.

upp till 10 000 URL:er per batch
  • En försändelse, inga portioner. Hela listan iväg på en gång; uppdelningen i hanterbara bitar faller bort.
  • Dygnsbudgeten är fortfarande bromsen. Tiotusen adresser levererade på en gång ger ändå tio dagars behandling. Batchens storlek ändrar alltså inte genomloppstiden.
  • Sorteringen är det egentliga beslutet. Vid en snäv budget är ordningen det enda du fortfarande styr, och den avgör utbytet under vecka ett.
  • För undantag, inte för rutinen. Publiceringstakten på en normal webbplats kommer aldrig i närheten av den här gränsen.
10 000
URL:er i en försändelse
1 000
uppnåeligt per dygn
3
räknare per pågående jobb
Indexing Hub · ingång 2

Sitemapbehandling

För samlingar som redan är organiserade i sitemapindex, till exempel per språk eller per kategori.

3 nivåer · 1 000 sitemaps per jobb
  • Uppladdning eller hänvisning. Både en uppladdad fil och en offentlig adress accepteras, så du kan räkna igenom en uppsättning innan den går live.
  • Kedjor tre lager djupt. Pekar ett index på ännu ett index vecklas kedjan ut i tre lager. Den som nästlar djupare gör klokt i att platta till strukturen.
  • Tusen filer i ett jobb. Därmed täcker en enda omgång hela uppdelningen av en stor webbplats efter språk, rubrik eller innehållstyp.
  • Två åt gången, tjugo i väntan. Gott om utrymme för en byrå med en handfull kunder i Mälardalen, förutsatt att någon håller ordning på kön: fredagens lansering ska ligga före rutinunderhållet.
3
nästlingsnivåer
1 000
sitemaps per jobb
2
jobb samtidigt
20
väntande jobb

Båda ingångarna mynnar ut i samma registrering och delar samma dygnsbudget. Hur indexeringsmodulen hos Semalt förhåller sig till analys- och kampanjdelarna beskrivs i plattformsöversikten.

Mekanik · IndexNow

Att knuffa i stället för att vänta

Traditionellt hämtar sökmotorn när det passar den. På en domän med låg aktivitet kan en djup sida vänta veckor på det, och vid en prisändring eller en anmälningsfrist är det precis de veckorna som räknas. IndexNow-kopplingen vänder på riktningen: webbplatsen skickar själv en signal till GoogleBot och BingBot så snart något har ändrats.

Vid ändringar ger det framför allt genomloppstid. En rättad beskrivning, ett nytt pris, ett öppnat program eller en återöppnad rubrik behöver inte vänta på att någon råkar komma förbi. För allt som hänger på en kalender — evenemang, besöksnäring, restaurang, säsongsvaror — avgör det om du syns medan efterfrågan finns eller först efteråt.

Att skicka in en URL är inte samma sak som att bli indexerad. Ett meddelande är en begäran om uppmärksamhet och ingen överenskommelse: sökmotorn avgör fortfarande själv om den kommer förbi och om den därefter sparar sidan. Det finns ingen sändningshastighet som får en tunn sida, en dubblett eller en adress med noindex upptagen ändå. Den som förväntar sig hundra procents upptagning efter en stor batch räknar fel — och det beror inte på verktyget utan på hur indexering fungerar.

Det som däremot ändras är frågan du kan ställa. Inte längre: känner sökmotorn ens till den här sidan? Utan: den känner till den, den har hämtat den, och ändå står den inte där — vad håller den tillbaka? Det sista går att utreda.

Lönar sig

Innehåll som just ändrats

Ett nytt pris, en ändrad öppettid, en uppdaterad beskrivning: här räknas varje dag du är snabbare ute.

  • Erbjudanden med ett slutdatum
  • Sidor som bär säsongen
Lönar sig

Adresser som just blivit tillgängliga

En upphävd blockering, en borttagen noindex eller en ny rubrik som ännu inte länkas från något håll.

  • Efter en lansering eller migrering
  • Efter en reparation av robots.txt
Lönar sig inte

Sidor som inte ändrats

Att anmäla igen utan ändring kostar dygnsbudget och ger ingenting. Sökmotorn har redan bildat sig en uppfattning.

  • Upprepning påskyndar inget beslut
Lönar sig inte

Sidor som blir avvisade

Tunt innehåll, en dubblett eller en motstridig canonical blir inte mer acceptabel av ett meddelande.

  • Först orsaken, sedan inskickningen
Bevis · Botbesöksloggen

Från förmodan till statuskod

Det är inte utskicket utan registreringen som gör modulen användbar. För varje adress noteras när en bot kom förbi, vilken status den mötte och vilken feldetalj som hörde till. Bredvid löper tre räknare — inskickade, hittade, misslyckade — som rör sig redan medan ett jobb pågår, så att du inte sitter och väntar i blindo.

De tre uppgifterna fungerar bara tillsammans. Tidpunkten visar om något över huvud taget hämtats; statusen avslöjar om du står inför en teknisk fråga eller en innehållsfråga; och feldetaljen pekar ut var reparationen ska ske. Därmed tar en diskussion slut som i många projekt kan dra ut i åratal — att Google av outgrundliga skäl skulle hålla en viss sida ute — och i stället börjar en uppgiftslista med ägare.

  • Anmäld, aldrig hämtad. Räknaren registrerar inskickningen, loggen förblir tom. Titta då på robots.txt, på serverns belastning och på en möjlig inbromsning av hela domänen.
  • Hämtad, men servern föll ihop. En 5xx under besöket är sällan ett problem med just den sidan; det pressar genomloppet för hela domänen.
  • Hämtad, men det stod ingenting. Status 404 eller 410 pekar på en föråldrad rad i sitemappen eller en hänvisning till raderat innehåll. Då ska den tas bort, inte skickas igen.
  • Hämtad, men omdirigerad. Du har anmält en mellanstation i stället för slutmålet. Anmäl hädanefter den slutliga adressen.
  • Hämtad, läst, avvisad. Tekniskt är allt i sin ordning. Orsaken ligger då i innehållet, i den kanoniska hänvisningen eller i saknade interna länkar.
Varför det gör så stor skillnad. Utan registrering förblir utebliven indexering en förmodan som kan överleva i månader. Med en tidpunkt och en statuskod ligger det inom en vecka ett avgränsat problem på bordet, inklusive den avdelning som ska lösa det.
Planering · Räkneexempel

Fyrtiotusen adresser vid tusen om dagen

Räkneexemplet nedan ska göra storleksordningen kännbar; det är uttryckligen ingen mätning på ett befintligt projekt.

En handelsplattform i Stockholm har 40 000 adresser i sina sitemaps, svenska och engelska versioner sammanlagt. Med 1 000 adresser om dagen tar en komplett omgång fyrtio dagar, och det talet gäller bara vid fullt utnyttjad budget utan en enda upprepning. Lägg till korrigeringsomgångarna och du är uppe i sex till åtta veckor. En batchstorlek på tiotusen ändrar ingenting på den punkten; den tar bara bort klipp-och-klistra-arbetet.

40 000
adresser i sitemaps
40
dagar vid osorterad inskickning
4 660
kommersiellt relevanta adresser
5
dagar för den delen

Sex veckor är för lång tid för ett erbjudande med ett utgångsdatum. Det talar inte emot verktyget utan för att sortera. En trolig uppdelning av samma fyrtiotusen ser ut så här.

  • Omkring 14 500 filter- och parametervarianter. Sorteringar, prisintervall, sessionsparametrar. Det är en canonical-fråga; förbrukad budget: noll.
  • Omkring 9 200 utgångna poster. Passerade datum, utgångna varor. De kräver en omdirigering eller en prydlig 410, inte en inskickning.
  • Omkring 260 rubrik- och landningssidor. De bär merparten av omsättningen och kan vara på plats på en fjärdedel av en dygnsbudget.
  • Omkring 4 400 aktuella erbjudandesidor på båda språken. De följer på fyra till fem dagar och täcker den löpande handeln.
  • Omkring 11 640 arkiv- och långsvanssidor. De rullar därefter med i bakgrunden, utan frist och utan press.

Det som såg ut som fyrtio dagar krymper därmed till fem dagar för allt som ger pengar. Vinsten kommer ur sorteringen och inte ur tekniken. För en tvåspråkig svensk webbplats tillkommer ett kriterium: bestäm uttryckligen vilken språkversion som går först. Eftersom den svenska volymen redan från början är låg är frestelsen stor att prioritera den engelska versionen efter råa tal — men de engelska sidorna konkurrerar mot ett betydligt bredare fält, och en saknad svensk sida med tydlig köpavsikt kostar mer än totalen antyder. Synlighetsrapporterna på samma plattform ligger i samma konto, så den kontrollen behöver inte sättas upp separat.

Underhåll · Sitemaps

Sitemaphygien och en användbar arbetsordning

En sitemap är ingen lagerlista utan en inställning: med varje rad säger du att just den här sidan är värd att spara. Består en fjärdedel av filen av omdirigeringar, felsidor och adresser med noindex sjunker trovärdigheten för alltihop — även för de rader som med full rätt står där.

Ta med

Indexerbara slutmål

Bara kanoniska adresser med status 200, skrivna exakt som de står i sin slutliga form.

  • Sanningsenlig lastmod, ingen nattlig uppfräschning
  • Egna filer per språk och per innehållstyp
  • Ett överordnat index som håller sig inom tre lager
Ta inte med

Allt som ändå avvisas

Varje adress som sökmotorn under alla omständigheter avvisar försvagar filens utsaga.

  • Noindex, blockerade adresser, omdirigeringar
  • Filtrerade varianter och interna sökresultat
  • Varukorg, kundzon, testservrar, felsidor

Arbetsordningen börjar därför med städning och inte med utskick. Sanera först filerna och låt dem sedan läsas in, som uppladdning eller som hänvisning, beroende på om de redan ligger offentligt. Det som kommer tillbaka är en nollmätning: hur många adresser som hittades, hur många som föll bort och vilka statuskoder som hopar sig.

Den fellistan städar du i innan en enda dygnsbudget går åt till den. Först därefter skickas den sorterade listan iväg, med de bärande sidorna överst. En vecka senare innehåller loggen material nog för tre högar: hämtad och sparad, hämtad och avvisad, samt aldrig besökt. Den sista högen är tekniskt arbete, den mellersta redaktionellt.

Månatlig kontroll. Att lägga filen bredvid webbplatsens faktiska tillstånd tar en halvtimme och förhindrar att det efter ett par år ligger en lista som ingen tar på allvar. Sitemapbehandlingen i panelen lämpar sig lika väl för den rutinen som för den stora första omgången; besläktade tekniska analyser är samlade på vår blogg.

Vanliga frågor

Hur lång tid tar det innan en inskickad adress står i indexet?

Det finns ingen fast frist, och varje siffra du läser någonstans är en uppskattning. Det du däremot förkortar är vägen till upptäckt och till den första hämtningen. Själva upptagningen förblir sökmotorns beslut. Loggen visar under alla omständigheter om hämtningen har ägt rum, och därmed har du redan halva svaret.

Räcker tusen adresser om dagen för en medelstor webbshop?

För den dagliga takten nästan alltid. Även ett intensivt publiceringsschema håller sig långt under tusen ändrade adresser per dygn. Trångt blir det vid en första fullständig genomräkning, vid en omdesign eller vid en migrering — just de tillfällen då försortering lönar sig, eftersom den kommersiellt bärande delen av en katalog som regel är liten.

Hur angriper man en webbplats som betjänar både svenska och engelska?

Båda versionerna är självständiga adresser och drar båda på samma dygnsbudget. Lägg filerna åtskilda per språk under ett överordnat index — den kedjan vecklas ut utan besvär — och bestäm därefter vilket språk som har företräde. Språkregistrering ligger inte i verktyget; det valet kommer ur din egen struktur och dina prioriteringar.

Vad händer om jag skickar in samma adress flera gånger?

Då går budget åt till ingenting. En sida som inte har ändrats bedöms inte snabbare av en upprepning. En ny anmälan lönar sig först efter en verklig ändring: annat innehåll, en rättad canonical eller en blockering du just tagit bort.

Varför står det sidor i indexet som jag just ville utesluta?

Nästan alltid på grund av förväxlingen mellan robots.txt och noindex. En adress som är blockerad via robots.txt hämtas inte, så den noindex som står i den blir aldrig läst — och sidan kan på grundval av externa hänvisningar bli kvar i indexet. Öppna åtkomsten, låt noindex bli läst, och blockera först därefter igen om det fortfarande behövs.

Där synlighet faktiskt börjar

Indexering är en underskattad flaskhals därför att den aldrig anmäler sig som en driftstörning. Inget larm går, ingen stapel blir röd; det finns bara sidor som får noll visningar. Den som inte mäter det kan lägga månader på texter och länkar medan blockeringen sitter ett steg tidigare.

Indexing Hub löser det inte med ett enda tryck. Modulen ställer upp tre saker bredvid varandra som var för sig betyder lite: en genomloppsgräns som tvingar fram ett val, en signal som förkortar vägen till upptäckt, och en registrering som ersätter gissningar med tidpunkter och statuskoder. Begränsningarna hör till bilden — tusen adresser per dygn är ändligt, två parallella jobb likaså, och ett meddelande förblir ett meddelande.

Just den nyktra hållningen gör arbetet planerbart. Den som har på papper att fyrtiotusen adresser vid full budget kräver fyrtio dagar ingår andra överenskommelser än den som trycker på skicka och hoppas på det bästa. Vill du veta hur många av dina egna sidor som faktiskt hämtas, börja med en sitemapomgång via Semalt-panelen och ditt första indexeringsjobb. Den första statusbilden är som regel mer lärorik än väntat — och på tvåspråkiga svenska webbplatser ligger den största överraskningen nästan alltid i den språkversion ingen tittade på.