Cum creezi fișierul robots.txt

Cum creezi fișierul robots.txt fără să blochezi conținut important? Înainte să adaugi orice regulă, verifică fișierul existent și stabilește ce vrei să controlezi. O singură directivă greșită poate împiedica Google să acceseze pagini, imagini sau resurse necesare afișării site-ului.

În acest tutorial vei afla cum verifici fișierul existent, cum creezi fișierul robots.txt în WordPress și cum configurezi fișierul robots.txt corect. Vei înțelege și diferența dintre robots.txt și meta robots, astfel încât să alegi soluția potrivită pentru controlul crawlingului sau al indexării.

Pe scurt: Ca să înțelegi ce este fișierul robots.txt, reține că acesta le indică roboților motoarelor de căutare ce adrese pot accesa pe site. Fișierul controlează crawlingul, nu garantează eliminarea unei pagini din rezultatele Google și nu protejează conținutul confidențial.

Înainte să creezi sau să modifici regulile, accesează adresa /robots.txt și verifică fișierul deja publicat.

Ce este fișierul robots.txt?

Dacă vrei să înțelegi ce este fișierul robots.txt, îl poți privi ca pe un set public de instrucțiuni adresate crawlerelor. Prin directive precum User-agent, Disallow și Allow, precizezi ce zone ale site-ului pot fi accesate. Fișierul trebuie publicat la rădăcina hostului pentru care stabilește regulile:

https://exemplu.ro/robots.txt

Un fișier disponibil la https://exemplu.ro/director/robots.txt nu controlează crawlingul site-ului. Regulile se aplică numai protocolului, hostului și portului pentru care este publicat fișierul. De exemplu, https://exemplu.ro/ și https://blog.exemplu.ro/ pot avea fișiere robots.txt diferite.

Când un crawler compatibil vizitează site-ul, solicită mai întâi fișierul robots.txt și interpretează grupul de reguli care i se aplică. Aceste instrucțiuni pot limita solicitările către anumite căi, dar nu reprezintă un mecanism de securitate.

Fișierul este public. Orice persoană îi poate vedea conținutul, iar crawlerele rău intenționate îl pot ignora. Protejează informațiile sensibile prin autentificare, permisiuni pe server sau alte măsuri de securitate, nu prin Disallow. De asemenea, robots.txt nu este soluția potrivită pentru eliminarea unei pagini din Google.

Conform documentației Google despre robots.txt, o adresă blocată poate fi indexată fără conținut dacă Google o descoperă prin linkuri sau alte surse. Acum că ai înțeles ce este fișierul robots.txt, este important să știi că acesta reprezintă unul dintre elementele de bază ale SEO tehnic, deoarece influențează modul în care crawlerele accesează conținutul unui site.

Verifică dacă site-ul are deja un fișier robots.txt

Înainte să afli cum creezi fișierul robots.txt, verifică dacă site-ul furnizează deja unul. Astfel eviți să suprascrii o configurație funcțională sau să creezi un conflict între două metode de administrare.

Accesează adresa /robots.txt

Introdu în browser domeniul site-ului urmat de /robots.txt:

https://domeniul-tau.ro/robots.txt

Dacă vezi un document text, verifică:

  • ce grupuri User-agent sunt definite;
  • ce directoare sau fișiere sunt blocate;
  • dacă există reguli pentru crawlere individuale;
  • dacă directiva Sitemap indică o adresă validă;
  • dacă recunoști scopul fiecărei reguli.

Nu presupune că fișierul este corect doar pentru că se încarcă. O configurație poate fi accesibilă și validă sintactic, dar nepotrivită pentru structura site-ului.

Identifică dacă fișierul este virtual sau fizic

WordPress poate furniza un fișier robots.txt virtual atunci când nu găsește unul fizic în directorul rădăcină. Un plugin SEO poate modifica sau înlocui conținutul acestei versiuni virtuale.

Dacă ai acces la fișierele site-ului, verifică directorul în care se află foldere precum:

wp-admin
wp-content
wp-includes

Dacă în același director găsești robots.txt, site-ul utilizează un fișier fizic. Dacă nu îl găsești, dar adresa /robots.txt funcționează, versiunea afișată este probabil generată dinamic de WordPress, de un plugin sau de configurația serverului.

Identificarea sursei contează deoarece un fișier fizic poate avea prioritate față de versiunea virtuală și poate împiedica editarea prin plugin.

Verifică adresa sitemapului

Dacă fișierul conține directiva Sitemap, deschide adresa indicată într-o filă separată:

Sitemap: https://exemplu.ro/sitemap_index.xml

Adresa exactă depinde de sistemul care generează sitemapul. Nu presupune că toate site-urile WordPress folosesc /sitemap_index.xml. Declararea sitemapului în robots.txt ajută motoarele de căutare să îi descopere locația, dar nu garantează crawlingul sau indexarea adreselor incluse. Pentru mai multe detalii despre rolul acestuia, poți consulta ghidul despre sitemapul XML.

cum creezi fișierul robots.txt în WordPress
Exemplu despre cum creezi fișierul robots.txt în WordPress.

Cum creezi fișierul robots.txt în WordPress

Ai două metode principale: editezi versiunea virtuală printr-un plugin compatibil sau creezi un fișier fizic. Alege o singură metodă de administrare, ca să eviți confuzia și conflictele.

Înainte de modificare, păstrează o copie a configurației existente. Dacă lucrezi direct cu fișierele site-ului, este recomandat să ai și o copie de siguranță WordPress actuală.

Metoda 1: Editezi fișierul cu Rank Math

Dacă folosești Rank Math, poți administra fișierul virtual din panoul WordPress:

  1. Deschide Rank Math SEO.
  2. Activează Advanced Mode dacă pluginul funcționează în modul simplu.
  3. Accesează General Settings.
  4. Deschide secțiunea Edit robots.txt.
  5. Introdu sau modifică regulile.
  6. Salvează schimbările.
  7. Verifică rezultatul la adresa publică /robots.txt.

Traseul și condiția referitoare la modul avansat sunt confirmate în documentația oficială Rank Math.

Dacă opțiunea de editare lipsește sau modificările nu apar, verifică dacă există un fișier robots.txt fizic în directorul rădăcină. Rank Math generează o versiune virtuală și poate să nu o poată administra cât timp fișierul fizic este prezent.

Nu șterge fișierul fizic înainte să îi salvezi conținutul și să verifici de unde provin regulile. Dacă ai nevoie de ajutor și cu celelalte opțiuni ale pluginului, consultă ghidul despre configurarea Rank Math SEO.

Metoda 2: Creezi un fișier robots.txt fizic

Poți crea fișierul cu un editor de text simplu, precum Notepad sau Notepad++:

  1. Creează un document text nou.
  2. Adaugă numai regulile necesare.
  3. Salvează documentul cu numele exact robots.txt.
  4. Verifică să nu fi fost salvat ca robots.txt.txt.
  5. Încarcă fișierul în directorul rădăcină al domeniului.
  6. Deschide adresa /robots.txt și confirmă conținutul public.

Poți încărca documentul prin File Manager din panoul de hosting sau prin FTP. Dacă alegi a doua variantă, urmează pașii din ghidul despre folosirea FTP în WordPress.

Directorul rădăcină diferă între furnizorii de hosting. Poate fi numit public_html, www, htdocs sau poate avea numele domeniului. Confirmă că lucrezi în directorul site-ului corect înainte să înlocuiești un fișier existent.

Ce metodă este potrivită pentru tine?

Folosește Rank Math dacă pluginul generează deja fișierul virtual și vrei să gestionezi regulile din WordPress. Este varianta mai accesibilă pentru un utilizator care nu lucrează frecvent cu fișierele serverului.

Alege un fișier fizic dacă nu folosești un plugin compatibil sau dacă ai nevoie de control direct asupra configurației. În acest caz, editează-l dintr-un singur loc și păstrează o copie a versiunii anterioare.

Indiferent cum creezi fișierul robots.txt în WordPress, metoda aleasă nu îmbunătățește SEO prin ea însăși. Contează regulile publicate la /robots.txt și efectul lor asupra adreselor site-ului.

Cum configurezi fișierul robots.txt

Ca să înțelegi cum configurezi fișierul robots.txt, trebuie să cunoști directivele și modul în care sunt grupate. O configurație scurtă și justificată este mai ușor de verificat decât o listă extinsă de reguli copiate.

User-agent

Directiva User-agent identifică robotul căruia i se aplică regulile următoare. Caracterul * reprezintă toate crawlerele care recunosc această regulă:

User-agent: *

Pentru un robot anume, folosește numele său recunoscut:

User-agent: Googlebot

Directivele Allow și Disallow de sub un User-agent formează un grup. Dacă începi un alt grup, regulile următoare se aplică noului crawler.

Nu adăuga grupuri pentru roboți individuali dacă vrei să le transmiți tuturor aceleași instrucțiuni.

Disallow

Directiva Disallow blochează crawlingul căii indicate:

User-agent: *
Disallow: /wp-admin/

O valoare goală nu blochează nicio cale:

User-agent: *
Disallow:

În schimb, o bară oblică blochează întregul site pentru grupul respectiv:

User-agent: *
Disallow: /

Diferența dintre cele două exemple este esențială. Verifică întotdeauna ce apare după Disallow: înainte să publici fișierul.

Allow

Directiva Allow creează o excepție într-o zonă blocată:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

În acest exemplu, crawlerul nu accesează în mod obișnuit directorul /wp-admin/, dar poate solicita fișierul admin-ajax.php. Nu folosi Allow pentru toate adresele pe care nu le-ai blocat. În lipsa unei reguli Disallow aplicabile, accesul este deja permis.

Sitemap

Directiva Sitemap declară adresa completă a sitemapului:

Sitemap: https://exemplu.ro/sitemap_index.xml

Adresa trebuie să includă protocolul și domeniul. Poți declara mai multe sitemapuri, fiecare prin propria directivă:

Sitemap: https://exemplu.ro/sitemap-posts.xml
Sitemap: https://exemplu.ro/sitemap-pages.xml

Pentru lizibilitate, plasează directivele Sitemap separat de grupurile crawlerelor, de obicei la final.

Comentarii și reguli de sintaxă utile

Un comentariu începe cu # și nu este interpretat ca regulă:

# Reguli pentru zona de administrare
User-agent: *
Disallow: /wp-admin/

Alte particularități importante:

  • * poate înlocui o succesiune de caractere;
  • $ marchează finalul adresei;
  • căile sunt sensibile la diferențele dintre litere mari și mici;
  • parametrii și caracterele din cale trebuie scrise exact;
  • pentru Google, când mai multe reguli corespund unei adrese, regula bazată pe calea cea mai specifică are prioritate;
  • dacă două reguli Google au aceeași lungime și intră în conflict, este folosită regula mai puțin restrictivă.

De exemplu, următoarea regulă corespunde adreselor care se termină în .pdf:

User-agent: Googlebot
Disallow: /*.pdf$

Nu utiliza metacaractere dacă o cale exactă rezolvă problema. Regulile generale pot afecta mai multe adrese decât intenționezi.

Google explică interpretarea directivelor și a grupurilor în documentația tehnică robots.txt.

Din experiență: Una dintre cele mai frecvente greșeli este copierea unui fișier robots.txt fără a verifica dacă regulile se potrivesc site-ului. Dacă înțelegi cum configurezi fișierul robots.txt, vei evita blocarea accidentală a unor directoare sau pagini importante pentru crawling și indexare.

Robots.txt vs meta robots

Acum că ai înțeles cum configurezi fișierul robots.txt, următorul pas este să știi când trebuie să folosești robots.txt și când este mai potrivită o directivă meta robots. Comparația robots.txt vs meta robots pornește de la obiectiv: vrei să limitezi accesul crawlerului sau vrei să controlezi indexarea unei resurse?

ObiectivSoluția potrivită
Limitezi crawlingul unei căirobots.txt
Soliciți neindexarea unei pagini HTMLmeta robots noindex
Soliciți neindexarea unui PDF sau altui fișierantetul HTTP X-Robots-Tag
Protejezi informații confidențialeautentificare sau restricții pe server
Indici locația sitemapuluidirectiva Sitemap sau Search Console

Fișierul robots.txt este citit înainte ca robotul să solicite pagina. Meta robots se află în codul paginii, iar crawlerul trebuie să o acceseze pentru a vedea instrucțiunea.

O directivă pentru o pagină HTML poate arăta astfel:

<meta name="robots" content="noindex">

Pentru un document PDF sau altă resursă non-HTML, poți transmite instrucțiunea prin răspunsul serverului:

X-Robots-Tag: noindex

Nu bloca prin robots.txt o pagină pe care ai adăugat noindex. Dacă Googlebot nu poate accesa pagina, nu poate citi directiva. Pagina poate continua să apară în rezultate dacă Google îi descoperă adresa prin alte surse. Această condiție este precizată în documentația Google despre blocarea indexării.

Prin urmare:

  • folosește robots.txt pentru controlul crawlingului;
  • folosește meta robots pentru indexarea paginilor HTML;
  • folosește X-Robots-Tag când ai nevoie de instrucțiuni pentru alte tipuri de fișiere;
  • folosește metode de securitate reale când accesul trebuie restricționat.

Deci, comparația robots.txt vs meta robots nu înseamnă că una dintre metode este mai bună. Fiecare are un rol diferit, iar alegerea corectă depinde de ceea ce vrei să controlezi: crawlingul sau indexarea.

Exemplu de fișier robots.txt pentru WordPress

Pentru un site WordPress obișnuit, următorul exemplu poate fi un punct de plecare:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://exemplu.ro/sitemap_index.xml

Configurația transmite următoarele instrucțiuni:

  • User-agent: * aplică grupul tuturor crawlerelor compatibile;
  • Disallow: /wp-admin/ limitează crawlingul directorului administrativ;
  • Allow: /wp-admin/admin-ajax.php permite accesarea fișierului aflat în zona blocată;
  • Sitemap declară locația sitemapului XML.

Ce trebuie să personalizezi?

Înlocuiește obligatoriu adresa sitemapului cu adresa reală a site-ului tău. Verifică rezultatul în browser înainte să publici configurația.

Păstrează regulile pentru /wp-admin/ și admin-ajax.php numai dacă se potrivesc instalării tale WordPress. Nu presupune că trebuie să modifici exemplul prin adăugarea altor directoare.

Dacă site-ul folosește subdirectoare, aplicații separate, o instalare WordPress neobișnuită sau reguli pentru crawlere individuale, configurația poate necesita adaptare.

Ce nu ar trebui să copiezi fără verificare?

Când stabilești cum creezi fișierul robots.txt pentru site-ul tău, nu copia automat reguli care blochează:

  • directoarele temei sau ale pluginurilor;
  • /wp-content/ ori /wp-includes/;
  • fișiere CSS și JavaScript;
  • directoare cu imagini;
  • pagini de categorie, etichete sau arhive;
  • parametri URL folosiți de funcții importante;
  • rezultate interne de căutare sau filtre;
  • crawlere pe care nu le-ai identificat.

O regulă întâlnită pe alt site reflectă structura și obiectivele acelui site. Înainte să o folosești, identifică adresele afectate, motivul blocării și eventualele excepții necesare. Nu modifica reguli existente doar pentru că exemplul de mai sus arată diferit. Dacă fișierul actual este simplu, permite accesul la conținutul important și declară sitemapul corect, este posibil să nu necesite nicio schimbare.

cum verifici fișierul robots.txt în WordPress
Verifică fișierul robots.txt în WordPress după fiecare modificare.

Cum verifici fișierul robots.txt după modificare

După ce modifici fișierul, este recomandat să verifici dacă regulile funcționează așa cum te aștepți. Indiferent de concluzia la care ai ajuns în comparația robots.txt vs meta robots, verifică întotdeauna rezultatul după fiecare modificare. După ce ai stabilit cum creezi fișierul robots.txt și ai salvat configurația, verifică rezultatul public și câteva adrese reprezentative. Nu te limita la confirmarea că fișierul există.

Verifică fișierul public și răspunsul serverului

Accesează:

https://domeniul-tau.ro/robots.txt

Confirmă că:

  • fișierul se deschide;
  • vezi versiunea pe care tocmai ai salvat-o;
  • nu apare cod HTML sau o pagină de eroare în locul textului;
  • domeniul și protocolul sunt corecte;
  • răspunsul serverului nu redirecționează către un host nepotrivit.

Dacă modificările făcute prin plugin nu apar, caută un fișier fizic sau verifică sistemele de cache.

Verifică sintaxa și căile

Revizuiește fiecare grup separat și identifică exact adresele afectate. Acordă atenție diferenței dintre:

Disallow:

și:

Disallow: /

Verifică și majusculele, barele oblice, metacaracterele, parametrii și eventualele spații introduse accidental.

Testează paginile și resursele importante

Alege adrese reprezentative pentru:

  • pagina principală;
  • articole și pagini publice;
  • imagini importante;
  • fișiere CSS și JavaScript;
  • directoare blocate intenționat;
  • orice tip de adresă vizat de o regulă nouă.

Pentru o adresă importantă poți folosi instrumentul URL Inspection din Search Console. Acesta te ajută să vezi dacă Google raportează adresa ca fiind blocată de robots.txt.

Verifică sitemapul și Search Console

Deschide fiecare adresă declarată prin Sitemap și confirmă că sitemapul este disponibil.

Raportul robots.txt din Google Search Console arată fișierele identificate pentru principalele hosturi ale proprietății, data ultimei accesări și eventualele avertizări sau erori. În situații urgente, raportul permite și solicitarea unei noi accesări a fișierului, conform documentației Search Console.

Înainte să consideri modificarea finală, confirmă că:

  • fișierul public conține regulile salvate;
  • paginile importante nu sunt blocate;
  • resursele necesare redării paginilor rămân accesibile;
  • căile blocate corespund exact obiectivului;
  • sitemapul este disponibil la adresa declarată;
  • Search Console nu indică o problemă pe care ai introdus-o prin modificare.

Greșeli frecvente

Chiar dacă știi cum creezi fișierul robots.txt, o regulă nepotrivită poate bloca pagini sau resurse importante. Verifică următoarele greșeli înainte să publici configurația.

Copierea unei configurații fără să înțelegi ce face

Aceasta este sursa multor probleme. Listele lungi de reguli pot părea complete, dar includ frecvent directoare, parametri sau excepții specifice altui site.

Analizează separat fiecare directivă. Dacă nu poți identifica scopul și adresele afectate, nu o adăuga.

Blocarea accidentală a întregului site

Următoarea configurație solicită tuturor crawlerelor din grup să nu acceseze nicio adresă:

User-agent: *
Disallow: /

Regula poate fi folosită intenționat într-un mediu care nu trebuie accesat de crawlere, dar devine critică pe site-ul public. Verifică fișierul după lansarea sau migrarea unui site.

Folosirea robots.txt pentru controlul indexării

Blocarea crawlingului nu garantează eliminarea unei adrese din Google. Dacă obiectivul este noindex, păstrează pagina accesibilă robotului și folosește o metodă destinată indexării.

Blocarea resurselor necesare afișării

O regulă generală poate împiedica Google să acceseze fișiere CSS, JavaScript sau imagini folosite pentru redare. Nu bloca un director tehnic înainte să verifici ce resurse publice conține și cum sunt folosite.

Conflictul dintre fișierul fizic și cel virtual

Poți modifica reguli în plugin fără să observi vreo schimbare la /robots.txt dacă serverul furnizează un fișier fizic. Stabilește sursa configurației și administreaz-o dintr-un singur loc.

Declararea unei adrese greșite pentru sitemap

Adresa sitemapului se poate schimba atunci când înlocuiești pluginul SEO sau modifici configurația site-ului. După o astfel de schimbare, verifică atât robots.txt, cât și sitemapul public.

Lipsa verificării după modificare

Salvarea fișierului nu confirmă că serverul publică versiunea corectă și nici că regulile au efectul dorit. Verifică documentul public, adresele importante și rapoartele relevante din Search Console după fiecare schimbare semnificativă.

Întrebări frecvente

Trebuie actualizat periodic fișierul robots.txt?

Nu trebuie să actualizezi periodic fișierul robots.txt, însă este recomandat să verifici și cum configurezi fișierul robots.txt atunci când schimbi structura site-ului, domeniul sau subdomeniile, pluginul care generează sitemapul, metoda de administrare a fișierului ori regulile aplicate crawlerelor.

Are fiecare subdomeniu propriul fișier robots.txt?

Da. Fiecare subdomeniu poate avea propriul fișier robots.txt. Regulile publicate la https://exemplu.ro/robots.txt nu se aplică automat subdomeniului https://blog.exemplu.ro/. Dacă vrei reguli pentru subdomeniu, publică fișierul la rădăcina acelui host: https://blog.exemplu.ro/robots.txt

Ce se întâmplă dacă /robots.txt returnează 404?

Dacă fișierul robots.txt returnează o eroare 404 Not Found, Google consideră, în general, că nu există restricții de crawling definite prin acest fișier.

Această situație diferă de o eroare a serverului sau de imposibilitatea temporară de accesare a fișierului. Dacă adresa ar trebui să funcționeze, verifică răspunsul serverului și raportul robots.txt din Search Console înainte să presupui că totul este în regulă.

Concluzie

Ca să înțelegi cum creezi fișierul robots.txt în WordPress corect, pornește de la configurația deja publicată, nu de la un exemplu copiat. Identifică dacă fișierul este virtual sau fizic, alege o singură metodă de editare și adaugă numai reguli al căror efect îl înțelegi.

Indiferent cum configurezi fișierul robots.txt, păstrează regulile cât mai simple, personalizează adresa sitemapului și verifică paginile și resursele importante după fiecare schimbare. Dacă obiectivul tău este controlul indexării sau protejarea informațiilor, folosește metoda dedicată acelui scop, nu robots.txt.

Distribuie articolul:

Doryn

Autor și editor iSeoWP

Specialist în SEO și WordPress. Explică clar cum să optimizezi site-uri pentru performanță, vizibilitate și rezultate reale în Google.