எப்படி செய்வது வழிகாட்டிகள்

சர்வர் லாக் கோப்புகளை ஆய்வு செய்து தேடுபொறி போட்களை கண்காணிப்பது எப்படி?

  • 14 நிமிட வாசிப்பு
  • Hostragons குழு
சர்வர் லாக் கோப்புகளை ஆய்வு செய்து தேடுபொறி போட்களை கண்காணிப்பது எப்படி?

சர்வர் லாக் கோப்புகளை ஆய்வு செய்து தேடுபொறி போட்களை கண்காணிப்பது என்பது Googlebot, Bingbot மற்றும் பிற crawler-கள் உங்கள் தளத்தில் எந்த URL-களை, எவ்வளவு அடிக்கடி, எந்த HTTP status code-களுடன், எவ்வளவு server resource பயன்படுத்தி பார்வையிடுகின்றன என்பதை அறிய மிகவும் நம்பகமான வழியாகும். பல SEO கருவிகள் கணிப்பு மற்றும் மாதிரித் தரவுகளை வழங்கினாலும், server logs என்பது உங்கள் server நேரடியாக பதிவு செய்த உண்மையான request-களை காட்டும் ஆதாரம். அதனால் crawl budget வீணாகிறதா, 404/500 பிழைகள் அதிகமா, redirect chain-கள் இருக்கிறதா, தேவையற்ற parameter URL-கள் crawl ஆகிறதா, முக்கியமான பக்கங்களுக்கு தேடுபொறி bot-கள் போதுமான அளவு வருகிறதா என்பதை தெளிவாக அளவிட முடியும்.

Technical SEO வேலைகள் பெரும்பாலும் on-page optimization, page speed, structured data, backlink, content quality போன்ற வெளியில் தெரியும் அம்சங்களை மையமாகக் கொண்டிருக்கும். ஆனால் தேடுபொறி உங்கள் தளத்தை உண்மையில் எப்படி பார்க்கிறது என்பதைப் புரிந்துகொள்ள bot behavior-ஐ ஆய்வு செய்ய வேண்டும். அந்த bot behavior-க்கான மிக raw-ஆன, நம்பகமான data source தான் access log எனப்படும் அணுகல் பதிவுகள். குறிப்பாக பெரிய e-commerce தளங்கள், news portal-கள், SaaS தயாரிப்புகள், பல மொழி இணையதளங்கள், தினமும் அல்லது வாரந்தோறும் அதிக உள்ளடக்கம் வெளியிடும் blog-கள் ஆகியவற்றுக்கு log analysis, indexing பிரச்சினைகளை கண்டுபிடித்து சரிசெய்ய மிகவும் முக்கியமான ஆயுதமாக மாறுகிறது.

இந்த வழிகாட்டியில் Hostragons blog வாசகர்களுக்காக, நடைமுறையில் பயன்படுத்தக்கூடிய முறையில் server log file-கள் எங்கே இருக்கும், எந்த fields-களை படிக்க வேண்டும், உண்மையான search engine bot-களை போலி bot-களிலிருந்து எப்படி பிரிக்க வேண்டும், SEO நோக்கில் எந்த metrics-களை கவனிக்க வேண்டும், analysis முடிவுகளை எப்படி செயல்திட்டமாக மாற்ற வேண்டும் என்பதைக் கட்டம் கட்டமாகப் பார்க்கப் போகிறோம். உங்கள் தளத்தில் regular log analysis செய்ய நம்பகமான hosting infrastructure தேவைப்பட்டால் Hostragons வலை ஹோஸ்டிங் மற்றும் அதிக traffic உள்ள project-களுக்கு Hostragons VPS சேவையகம் விருப்பங்களையும் பரிசீலிக்கலாம்.

சர்வர் லாக் கோப்பு என்றால் என்ன? SEO-க்கு ஏன் முக்கியம்?

சர்வர் லாக் கோப்பு என்பது உங்கள் web server-க்கு வரும் ஒவ்வொரு request-யும் பதிவு செய்யப்படும் daily record file ஆகும். ஒரு பயனர் உங்கள் home page-ஐ திறந்தாலும், Googlebot உங்கள் category page ஒன்றை crawl செய்தாலும், அல்லது ஒரு security scanner உங்கள் தளத்திற்கு request அனுப்பினாலும், அந்த நிகழ்வு log file-ல் எழுதப்படும். பொதுவாக தேதி, நேரம், IP address, கேட்கப்பட்ட URL, HTTP method, status code, response size, user-agent, சில சமயங்களில் response time போன்ற விவரங்கள் இதில் இருக்கும்.

SEO பார்வையில் log file-கள் முக்கியமானவை; ஏனெனில் தேடுபொறிகள் உங்கள் தளத்தை எப்படி crawl செய்கின்றன என்பதை நேரடியாக காட்டுகின்றன. Google Search Console உங்களுக்கு crawl statistics தரும்; ஆனால் URL level-ல் ஒவ்வொரு request-யையும், அனைத்து bot-களையும், server-இல் நிகழும் தற்சமய error-களையும் எப்போதும் முழு விவரத்துடன் தராது. Log analysis மூலம், உதாரணமாக கடந்த 7 நாட்களில் Googlebot 12,400 request செய்துள்ளது, அதில் 18% request-கள் 301 redirect-க்கு சென்றன, 6% request-கள் 404 பிழையில் முடிந்தன, 2% request-கள் 500 error பெற்றன, மேலும் உங்கள் முக்கிய product page-கள் மொத்த crawl-இல் 9% மட்டுமே பெற்றன என்பதை கணக்காக பார்க்க முடியும்.

இந்த data குறிப்பாக crawl budget management-க்கு மிகவும் பயனுள்ளது. Crawl budget என்பது ஒரு குறிப்பிட்ட காலத்தில் search engine bot-கள் உங்கள் தளத்தில் crawl செய்யக்கூடிய URL எண்ணிக்கையாக நினைக்கலாம். தேவையற்ற filters, pagination, search result pages, parameter URL-கள், தவறான redirects, duplicate pages ஆகியவை அதிகமாக இருந்தால், bot-கள் உங்கள் மதிப்புள்ள பக்கங்களுக்கு குறைவான நேரமே ஒதுக்கலாம். Log file-கள் இந்த வீணாக்கத்தை ஊகமாக அல்ல, ஆதாரத்துடன் காட்டுகின்றன.

தேடுபொறி போட்களை கண்காணிக்கும் போது எந்த கேள்விகளுக்கு பதில் தேட வேண்டும்?

வெற்றிகரமான log analysis என்பது file-ஐ திறந்து வரிகளை படிப்பது மட்டுமல்ல. முதலில் சரியான கேள்விகளை கேட்க வேண்டும். Technical SEO குழுக்கள் பொதுவாக கீழ்க்கண்ட கேள்விகளுக்குப் பதில் தேடுகின்றன:

  • Googlebot அதிகமாக எந்த URL குழுக்களை crawl செய்கிறது?
  • முக்கியமான பக்கங்கள் போதுமான அளவு பார்வையிடப்படுகிறதா?
  • Crawl request-களில் எத்தனை 200, 301, 302, 404, 410 அல்லது 5xx status code பெறுகின்றன?
  • robots.txt மூலம் தடுக்கப்பட்ட பகுதிகளுக்கும் bot-கள் தொடர்ந்து request அனுப்புகிறதா?
  • Parameter உள்ள, duplicate அல்லது குறைந்த மதிப்புள்ள URL-கள் crawl budget-ஐ வீணாக்குகிறதா?
  • Mobile Googlebot மற்றும் desktop Googlebot நடத்தை இடையே வேறுபாடு உள்ளதா?
  • Server response time, bot crawling-ஐ மெதுவாக்குகிறதா?
  • போலி bot-கள் Googlebot போல நடித்து server resource-களை சாப்பிடுகிறதா?

இந்த கேள்விகள் ஒவ்வொன்றும் நேரடியாக செயலில் மாறக்கூடியவை. எடுத்துக்காட்டாக Googlebot பழைய campaign URL-களை அதிகமாக 404 ஆக crawl செய்கிறது என்று தெரிந்தால், அவற்றை சம்பந்தப்பட்ட category பக்கங்களுக்கு 301 redirect செய்யலாம் அல்லது அவை நிரந்தரமாக நீக்கப்பட்டவை என்றால் 410 status code பயன்படுத்தலாம். Bot request-களில் 30% site search result page-களுக்குச் செல்கின்றன என்றால் robots.txt, canonical, noindex அல்லது URL parameter management-ஐ மீண்டும் வடிவமைக்க வேண்டியிருக்கும்.

Log கோப்புகள் எங்கே இருக்கும்?

Log file-கள் இருக்கும் இடம் நீங்கள் பயன்படுத்தும் hosting type, control panel மற்றும் web server software-ஐப் பொறுத்து மாறும். Shared hosting பயன்படுத்தும் தளங்களில் access logs பொதுவாக cPanel, Plesk அல்லது hosting panel-இல் உள்ள statistics, visitors, raw access logs போன்ற பிரிவுகளில் கிடைக்கும். VPS அல்லது dedicated server பயன்படுத்தும் project-களில் log file-களை SSH மூலம் அணுகுவது வழக்கம்.

பொதுவான Apache மற்றும் Nginx Log இடங்கள்

Linux அடிப்படையிலான server-களில் Apache access log பெரும்பாலும் /var/log/apache2/access.log அல்லது /var/log/httpd/access_log பாதையில் இருக்கும். Nginx பயன்படுத்தும் server-களில் /var/log/nginx/access.log கோப்பு பொதுவாக காணப்படும். Domain-க்கு தனியாக அமைக்கப்பட்ட virtual host configuration-களில் ஒவ்வொரு website-க்கும் தனி log file வைத்திருக்கலாம். பல தளங்களை ஒரே server-ல் நடத்தும் அமைப்புகளில் இது analysis accuracy-ஐ அதிகரிக்கும்.

ஒரு log line இவ்வாறு இருக்கலாம்: 66.249.66.1 - - [12/Mar/2026:10:15:22 +0300] GET /blog/teknik-seo HTTP/2.0 200 18432 Googlebot/2.1. இந்த ஒரு வரியிலிருந்தே IP address, request நேரம், URL, status code, response size, user-agent ஆகியவற்றை படிக்க முடியும். உங்கள் log format-ல் response time இருந்தால் performance analysis-க்கு அது இன்னும் வலுவான dataset ஆகும்.

Hosting Panel மூலம் Log பதிவிறக்கம் செய்தல்

அதிக technical knowledge இல்லாதவர்களுக்கு hosting panel-இல் இருந்து log download செய்வது மிகவும் எளிய வழி. Panel-ல் access logs, raw logs, visitors, web statistics போன்ற பெயர்களில் உள்ள பகுதிகளைத் தேடலாம். பெரிய தளங்களில் daily log file-களில் பல லட்சம் வரிகள் இருக்கலாம்; எனவே compressed வடிவில் download செய்து analysis செய்வது சிறந்தது. Regular access, secure backup, performance tracking ஆகியவற்றை எளிதாக்க Hostragons cPanel விற்பனை போன்ற நிர்வகிக்க சுலபமான தீர்வுகள் உங்கள் பணியை வேகப்படுத்தும்.

Log வரியில் SEO-க்கு முக்கியமான புலங்கள்

ஒவ்வொரு log line-க்கும் ஒரே அளவு மதிப்பு இல்லை. SEO நோக்கில் முதலில் கவனிக்க வேண்டிய சில fields உள்ளன. IP address, bot உண்மையானதா என்பதைச் சரிபார்க்க உதவும். Date மற்றும் time, crawling எந்த நாள், எந்த நேரத்தில் அதிகம் நடந்தது என்பதை கணக்கிட உதவும். HTTP method பொதுவாக GET ஆக இருக்கும்; விசித்திரமான POST request-களை security பார்வையில் ஆய்வு செய்யலாம். Requested URL எந்த page crawl செய்யப்பட்டது என்பதை காட்டும். Status code அந்த page அணுகக்கூடியதா என்பதை சொல்வது. User-agent request அனுப்பிய bot அல்லது browser-ஐ அடையாளம் காண உதவும். Response time அல்லது time taken field இருந்தால் bot experience மற்றும் server load புரிந்துகொள்ள மிகவும் பயனுள்ளதாக இருக்கும்.

உதாரணமாக கடந்த 30 நாட்களில் 50,000 Googlebot request உள்ளதாகக் கொள்வோம். இதில் 38,000 request-கள் 200, 7,500 request-கள் 301, 2,000 request-கள் 404, 1,200 request-கள் 304, 800 request-கள் 5xx, 500 request-கள் 302 என்றால் பிரச்சினை தெளிவாக தெரிகிறது: redirects மற்றும் errors சேர்த்து 20% மேல் உள்ளது. Technical SEO இலக்கு என்னவென்றால் 5xx errors-ஐ பூஜ்யத்திற்கு நெருக்கமாக குறைப்பது, 404-களை பொருத்தமான அளவுக்கு குறைப்பது, தேவையற்ற redirect-களை சுருக்குவது.

உண்மையான Googlebot மற்றும் போலி Bot-ஐ எப்படி வேறுபடுத்துவது?

User-agent மட்டும் நம்பகமான அடையாளமாக கருதக்கூடாது. தீய நோக்கமுள்ள crawler-கள் தங்களை Googlebot போல காட்டிக்கொள்ளலாம். அதனால் உண்மையான search engine bot-களை உறுதிப்படுத்த reverse DNS மற்றும் forward DNS check செய்ய வேண்டும். Google பரிந்துரைக்கும் முறை: IP address-ஐ reverse DNS மூலம் host name ஆக மாற்ற வேண்டும்; அந்த host name googlebot.com அல்லது google.com-ல் முடிவதா என்பதை சரிபார்க்க வேண்டும்; பின்னர் அந்த host name மீண்டும் அதே IP-க்கு resolve ஆகிறதா என்பதை பார்க்க வேண்டும்.

செயல்முறை எளிது: log-ல் Googlebot user-agent உடன் வந்த IP address-ஐ எடுக்கவும். Terminal-ல் host 66.249.66.1 அல்லது nslookup 66.249.66.1 command மூலம் reverse DNS query செய்யவும். கிடைக்கும் domain name crawl-66-249-66-1.googlebot.com போன்ற நம்பகமான Google domain ஆக இருந்தால் அடுத்த கட்டத்துக்கு செல்லலாம். அந்த domain name-ஐ மீண்டும் IP-க்கு resolve செய்யவும். முடிவு முதல் IP-யுடன் பொருந்தினால் அந்த bot உண்மையானதாக இருக்க வாய்ப்பு அதிகம். பொருந்தவில்லை அல்லது தொடர்பில்லாத domain வந்தால் அதை fake bot என்று கருத வேண்டும்.

இந்த verification குறிப்பாக அதிக resource பயன்படுத்தும் bot-களை பிரிக்க முக்கியமானது. Fake Googlebot-கள் server resource-களை வீணாக்கலாம், security vulnerability-களை scan செய்யலாம், அல்லது content scraping நோக்கத்துடன் செயல்படலாம். இத்தகைய traffic கண்டுபிடிக்கப்பட்டால் WAF, rate limit, IP blocking, firewall rules போன்ற பாதுகாப்பு நடவடிக்கைகளை செயல்படுத்தலாம். HTTPS மற்றும் பாதுகாப்பான connection அமைப்புக்கு Hostragons SSL சான்றிதழ்கள் பக்கத்தைப் பார்க்கலாம்.

Log Analysis செய்ய பயன்படுத்தக்கூடிய கருவிகள்

Log analysis-க்கு ஒரே ஒரு சரியான கருவி என்று இல்லை. Website அளவு, technical team அனுபவம், budget ஆகியவற்றைப் பொறுத்து முறை மாறும். சிறிய தளங்களுக்கு Excel, Google Sheets அல்லது simple command line filters போதுமானதாக இருக்கும். நடுத்தர தளங்களுக்கு Screaming Frog Log File Analyser, GoAccess அல்லது Python scripts சிறப்பாக வேலை செய்யும். Enterprise அமைப்புகளில் Elasticsearch, Logstash, Kibana, BigQuery அல்லது SIEM தீர்வுகள் பயன்படுத்தப்படலாம்.

Log Analysis செய்ய பயன்படுத்தக்கூடிய கருவிகள்
முறைமிக பொருத்தமான பயன்பாடுநன்மைவரம்பு
Excel அல்லது Sheetsசிறிய blog-கள், குறைந்த trafficகற்றுக்கொள்ள எளிது, விரைவான filtering செய்யலாம்பெரிய file-களில் மெதுவாகும், row limit பிரச்சினை வரும்
Command lineTechnical பயனர்கள், VPS server-கள்வேகமானது, இலவசம், automation-க்கு ஏற்றதுLinux command அறிவு தேவை
SEO log analysis toolsநடுத்தர மற்றும் பெரிய தளங்கள்Bot, URL, status code reports தயாராக கிடைக்கும்License cost இருக்கலாம்
ELK அல்லது BigQueryEnterprise மற்றும் அதிக traffic தளங்கள்Real-time, scalable, மிகவும் detailedSetup மற்றும் maintenance-க்கு நிபுணத்துவம் தேவை

நடைமுறை தொடக்கமாக கடந்த 7 அல்லது 14 நாட்களின் log-களை download செய்து Googlebot, Bingbot, YandexBot மற்றும் முக்கியமான மற்ற bot user-agent-களை மட்டும் filter செய்தால் போதும். பிறகு URL, status code, date field-களை வைத்து pivot table உருவாக்கலாம். முதல் analysis-ன் நோக்கம் முழுமையான data warehouse கட்டுவது அல்ல; பெரிய SEO leakage எங்கே நடக்கிறது என்பதை விரைவாகக் காண்பதே.

கட்டம் கட்டமாக Server Log File Analysis

1. Analysis இலக்கை தீர்மானிக்கவும்

முதலில் நீங்கள் என்ன தெரிந்துகொள்ள விரும்புகிறீர்கள் என்பதை தெளிவுபடுத்துங்கள். புதிதாக வெளியிட்ட content index ஆகவில்லையா? Category pages போதுமான அளவு crawl ஆகவில்லையா? Server errors organic visibility-ஐ பாதிக்கிறதா? இலக்கு தெளிவாக இருந்தால் log file-ல் தேட வேண்டிய signals-களும் தெளிவாகும். உதாரணமாக indexing பிரச்சினைக்காக முக்கிய URL-களை Googlebot கடந்த எத்தனை நாட்களில் crawl செய்தது என்பதைப் பார்க்கலாம்; performance பிரச்சினைக்காக 5xx codes மற்றும் response time ஆய்வு செய்யலாம்.

2. சரியான காலவரம்பை தேர்ந்தெடுக்கவும்

மிகக் குறுகிய காலம் தவறான முடிவுகளைத் தரலாம்; மிகவும் நீண்ட காலம் file size-ஐ தேவையற்ற அளவுக்கு பெரிதாக்கும். சிறிய மற்றும் நடுத்தர தளங்களுக்கு 14 முதல் 30 நாட்கள் நல்ல தொடக்கம். News sites போன்ற வேகமாக update ஆகும் அமைப்புகளில் 3 முதல் 7 நாட்கள் கூட meaningful data தரும். பெரிய e-commerce தளங்களில் season, campaign, category update போன்ற மாற்றங்களை தனியாக tag செய்து பார்க்க வேண்டும்.

3. Bot Traffic-ஐ Filter செய்யவும்

User-agent field-ல் Googlebot, Googlebot-Image, Googlebot-News, Bingbot, YandexBot, DuckDuckBot, Applebot போன்ற bot-களை தனியாக பிரிக்கவும். ஆனால் critical reports-ல் உண்மையான bot verification செய்வதை மறக்காதீர்கள். Mobile-first indexing காரணமாக Googlebot Smartphone request-களை தனியாக கண்காணிக்க வேண்டும். Desktop bot மிகவும் active-ஆகவும், mobile bot மிகவும் குறைவாகவும் தெரிந்தால் configuration அல்லது access பிரச்சினை இருக்கலாம்.

4. URL குழுக்களை உருவாக்கவும்

பெரிய தளங்களில் ஒவ்வொரு URL-ஐ தனித்தனியாக ஆய்வு செய்வது பயனற்றதும் நேரம் பிடிப்பதும் ஆகும். URL-களை template அடிப்படையில் பிரிக்கவும்: home page, category, product, blog, tag, filter, search, pagination, image, API, static file போன்றவை. இதனால் bot-கள் எந்த site section-க்கு அதிக முக்கியத்துவம் தருகின்றன என்பதை பார்க்கலாம். உதாரணமாக e-commerce தளத்தில் Googlebot request-களில் 42% filtered URL-களுக்கு, 18% product page-களுக்கு செல்கிறது என்றால் prioritization பிரச்சினை இருக்கலாம்.

5. Status Code-களை மதிப்பிடவும்

SEO log analysis-ல் status code-கள் முக்கியமான indicators. 200 என்பது successful access, 301 என்பது permanent redirect, 302 என்பது temporary redirect, 304 என்பது not modified response, 404 என்பது not found, 410 என்பது permanently removed, 429 என்பது too many requests, 5xx என்பது server error என்பதை குறிக்கும். இலக்கு என்னவென்றால் முக்கியமான pages முடிந்தவரை நேரடியாக 200 response தர வேண்டும்; bot-கள் error அல்லது தேவையற்ற redirect chain-களில் நேரத்தை வீணாக்கக் கூடாது.

6. Response Time மற்றும் Server Load-ஐ அளவிடவும்

உங்கள் log format response time-ஐ பதிவு செய்தால், bot request-களுக்கான average மற்றும் 95th percentile time-ஐ பாருங்கள். Average 180 ms என்று நல்லதாக தோன்றலாம்; ஆனால் 95th percentile 2,800 ms என்றால் சில URL type-கள் bot-களை மெதுவாக்கிக் கொண்டிருக்கலாம். குறிப்பாக filtered category, site search, dynamic report, heavy database query இயங்கும் pages ஆகியவற்றை கவனமாக ஆய்வு செய்ய வேண்டும். Performance பிரச்சினை இருந்தால் அதிக resource-களுக்காக Hostragons மேகச் சேவையகம் விருப்பங்களை பரிசீலிக்கலாம்.

SEO பார்வையில் மிகவும் முக்கியமான Log Analysis கண்டுபிடிப்புகள்

Crawl Budget வீணாகுதல்

Crawl budget வீணாகுதல் என்பது bot-கள் முக்கியமில்லாத URL-களில் தேவைக்குமேல் நேரம் செலவிடுவது. Parameter URL-கள், sorting filters, session ID-கள், print pages, முடிவில்லாத calendar archives, site search result pages ஆகியவை பொதுவான காரணங்கள். Log analysis-ல் இத்தகைய URL-கள் பெரிய சதவீதமாக இருப்பது தெரிந்தால் canonical, robots.txt, noindex, parameter simplification, internal link cleanup ஆகியவற்றை ஒன்றாகப் பரிசீலிக்க வேண்டும்.

முக்கிய பக்கங்கள் குறைவாக Crawl ஆகுதல்

சில நேரங்களில் பிரச்சினை bot-கள் அதிகமாக crawl செய்வது அல்ல; தவறான இடங்களை crawl செய்வதே. புதிய product pages, conversion வாய்ப்பு அதிகமான landing pages, புதுப்பிக்கப்பட்ட guide content போன்றவை போதுமான அளவு பார்வையிடப்படாமல் இருக்கலாம். காரணம் பலவீனமான internal linking, sitemap புதுப்பிக்கப்படாதது, site speed குறைவு, அல்லது URL site architecture-ல் மிகவும் ஆழத்தில் இருப்பது ஆகலாம். இந்நிலையில் XML sitemap-ஐ update செய்யவும், main category மற்றும் related content-களில் இருந்து internal link கொடுக்கவும், orphan pages-ஐ கண்டுபிடிக்கவும், URL depth-ஐ குறைக்கவும். Domain name மற்றும் project structure-ஐ திட்டமிடும் கட்டத்தில் இருந்தால் டொமைன் வினவல் மூலம் brand-க்கு ஏற்ற தொடக்கத்தை அமைக்கலாம்.

Redirect Chain-கள்

Log-களில் bot-கள் /eski-url முகவரியிலிருந்து /ara-url-க்கு, அங்கிருந்து /yeni-url-க்கு redirect ஆகுவது பொதுவாக காணப்படும். இத்தகைய chain-கள் user experience மற்றும் bot efficiency-ஐ குறைக்கும். சிறந்த அமைப்பு: பழைய URL நேரடியாக இறுதி URL-க்கு 301 கொடுக்க வேண்டும். பெரிய site migration project-களில் பழைய redirect rules சேர்ந்து சேர்ந்து chain உருவாக்கும். மாதாந்திர log check இந்த chain-களை ஆரம்பத்திலேயே கண்டுபிடிக்க உதவும்.

5xx பிழைகள் மற்றும் மாறிக்கொண்டிருக்கும் Accessibility

Search engine bot-கள் உங்கள் தளத்தில் அடிக்கடி 500, 502, 503 அல்லது 504 errors பார்த்தால் crawl frequency-ஐ குறைக்கலாம். இது குறிப்பாக campaign காலங்களில் organic performance-ஐ பாதிக்கும். Log-களில் 5xx error வந்த நேரம், URL type, bot type ஆகியவற்றைப் பார்த்து ஆராயுங்கள். உதாரணமாக ஒவ்வொரு இரவும் 02:00 மணிக்கு backup நடக்கும் போது 503 அதிகரிக்கிறது என்றால் maintenance window, resource planning அல்லது cache strategy மாற்றப்பட வேண்டும்.

Robots.txt, Sitemap மற்றும் Log Data-வை சேர்த்து வாசித்தல்

Log analysis தனிப்பட்ட முறையிலேயே வலுவானது; ஆனால் robots.txt, XML sitemap, Google Search Console data ஆகியவற்றுடன் சேர்த்து படித்தால் இன்னும் அதிக அர்த்தம் கிடைக்கும். Sitemap-ல் உள்ள URL-களை bot உண்மையில் crawl செய்கிறதா என்று ஒப்பிடுங்கள். Sitemap-ல் இல்லாத, ஆனால் அடிக்கடி crawl ஆகும் URL-களை கண்டுபிடியுங்கள். Robots.txt மூலம் தடைசெய்த பகுதிகளுக்கும் bot request வருகிறதா என்று சரிபாருங்கள். தடைசெய்யப்பட்ட URL-கள் search result-களில் தொடர்ந்து தெரிந்தால் robots.txt மட்டும் போதாது; noindex அல்லது removal strategy தேவைப்படலாம்.

ஒரு நல்ல நடைமுறை என்னவென்றால், ஒவ்வொரு மாதமும் மூன்று பட்டியல்கள் உருவாக்க வேண்டும்: sitemap-ல் இருந்தும் crawl ஆகாத முக்கிய URL-கள், sitemap-ல் இல்லாவிட்டும் அடிக்கடி crawl ஆகும் குறைந்த மதிப்புள்ள URL-கள், error code திருப்பும் bot request-கள். இந்த மூன்று பட்டியல்களே உங்கள் technical SEO roadmap-க்கான அடித்தளமாக இருக்கும்.

Log Analysis Report-ல் எந்த Metrics இருக்க வேண்டும்?

நிர்வகிக்கக்கூடிய report ஒன்றிற்கு அளவுக்கு அதிகமான metrics-ல் மூழ்காமல் action உருவாக்கும் indicators-ஐ தேர்வு செய்ய வேண்டும். கீழ்க்கண்ட metrics பெரும்பாலான தளங்களுக்கு நல்ல தொடக்கத் தொகுப்பாக இருக்கும்:

  • மொத்த bot request மற்றும் bot வாரியாக பகிர்வு
  • Googlebot Smartphone மற்றும் Desktop விகிதம்
  • Status code பகிர்வு: 200, 3xx, 4xx, 5xx
  • URL type வாரியாக crawl ratio
  • அதிகமாக crawl செய்யப்பட்ட முதல் 100 URL-கள்
  • ஒருபோதும் crawl ஆகாத அல்லது குறைவாக crawl ஆன முக்கிய URL-கள்
  • Average மற்றும் 95th percentile response time
  • அதிகமாக 404 மற்றும் 5xx தரும் URL-கள்
  • Parameter URL request ratio
  • Fake bot அல்லது சந்தேகத்துக்குரிய user-agent பட்டியல்

Report-ஐ வாராந்திரமாக அல்லது மாதாந்திரமாக comparison உடன் தயாரியுங்கள். உதாரணமாக ஜனவரியில் 5xx ratio 1.8% இருந்தது, பிப்ரவரியில் 0.2% ஆக குறைந்தது என்றால் infrastructure improvement-ன் தாக்கத்தை data மூலம் நிரூபித்ததாக ஆகும். அதேபோல் புதிய internal linking பிறகு blog content-களுக்கான Googlebot request 35% அதிகரித்தால், உங்கள் content architecture முடிவு data-வால் ஆதரிக்கப்படுகிறது.

செயல்படுத்தக்கூடிய உதாரணம்: 30 நாள் Log Analysis Scenario

ஒரு technology blog-இன் கடந்த 30 நாள் access log ஆய்வு செய்யப்பட்டதாகக் கற்பனை செய்யுங்கள். மொத்தம் 320,000 request-களில் 48,000 search engine bot request கண்டறியப்பட்டது. Googlebot request 39,500, Bingbot request 5,200, மற்ற bot-கள் 3,300. Status code பகிர்வில் 200 response ratio 78%, 301 ratio 11%, 404 ratio 7%, 5xx ratio 1.5%, மற்ற response-கள் 2.5% என்று வந்தது.

URL grouping செய்தபோது Googlebot request-களில் 28% tag pages-க்கு, 22% பழைய date archive pages-க்கு, 19% blog posts-க்கு, 8% category pages-க்கு, மீதமுள்ளவை images மற்றும் static files-க்கு சென்றது தெரியவந்தது. ஆனால் அந்த தளத்தின் organic traffic இலக்கு புதிய guide articles மற்றும் category clusters ஆக இருந்தது. Action ஆக குறைந்த மதிப்புள்ள tag pages noindex செய்யப்பட்டது, archive pages-க்கு கொடுக்கப்பட்ட internal links குறைக்கப்பட்டது, புதிய guide content home page மற்றும் related categories-இல் இருந்து link செய்யப்பட்டது, sitemap index செய்ய வேண்டிய URL-களுக்கே சுருக்கப்பட்டது.

அடுத்த 30 நாட்களில் Googlebot blog posts-க்கு ஒதுக்கிய request ratio 19%-இல் இருந்து 34%-ஆகவும், category pages-க்கு ஒதுக்கிய ratio 8%-இல் இருந்து 14%-ஆகவும் உயர்ந்தது. பழைய URL redirects மூலம் 404 ratio 7%-இல் இருந்து 2.1%-ஆக குறைந்தது. இந்த உதாரணம் log analysis என்பது வெறும் technical report அல்ல; நேரடியாக organic growth strategy-ஐ ஆதரிக்கும் decision mechanism என்பதை காட்டுகிறது.

அடிக்கடி செய்யப்படும் தவறுகள்

Log analysis-ல் பொதுவான முதல் தவறு user-agent தகவலை கண்மூடித்தனமாக நம்புவது. Fake bot-களை கருத்தில் கொள்ளாவிட்டால் reports தவறாக வழிநடத்தும். இரண்டாவது தவறு அனைத்து URL-களையும் ஒரே மதிப்புள்ளவை போல மதிப்பிடுவது. ஒரு privacy policy page குறைவாக crawl ஆகுவது மற்றும் main category page குறைவாக crawl ஆகுவது ஒரே தாக்கம் தராது. மூன்றாவது தவறு ஒரே நாள் data-விலிருந்து பெரிய முடிவுகள் எடுப்பது. Bot behavior நாள் தோறும் மாறலாம்; அதனால் meaningful period தேர்வு செய்ய வேண்டும்.

நான்காவது தவறு robots.txt மூலம் எல்லா பிரச்சினைகளும் தீர்ந்துவிடும் என்று நினைப்பது. Robots.txt crawling-ஐ கட்டுப்படுத்தலாம்; ஆனால் indexing management-க்கு அது எப்போதும் போதாது. ஐந்தாவது தவறு findings-ஐ action-ஆக மாற்றாமல் விடுவது. Log analysis முடிவில் redirects, internal linking, sitemap, canonical, performance, security போன்ற முடிவுகள் எடுக்கப்படாவிட்டால் அந்த report ஒரு file reading exercise ஆகவே மிஞ்சும்.

Security மற்றும் Privacy பார்வையில் கவனிக்க வேண்டியவை

Log file-களில் IP address மற்றும் request information இருப்பதால் அவற்றை கவனமாக சேமிக்க வேண்டும். அனுமதி இல்லாதவர்களுடன் பகிரக்கூடாது; analysis-க்காக download செய்த file-களை தேவையின்றி நீண்ட நேரம் personal computer-களில் வைத்திருக்கக் கூடாது; சாத்தியமானால் masking பயன்படுத்த வேண்டும். Enterprise project-களில் log retention period, KVKK போன்ற data protection சட்டங்கள் மற்றும் company policies-க்கு ஏற்ப இருக்க வேண்டும். மேலும் log file-களில் token, session parameter அல்லது sensitive query string தகவல்கள் தெரிந்தால் application side logging policy-ஐ மறுபரிசீலனை செய்ய வேண்டும்.

Security பார்வையில் log-கள் SEO-க்காக மட்டுமல்ல; attack detection-க்கும் மதிப்புடையவை. திடீரென அதிகரிக்கும் 404 attempts, admin panel scans, unusual POST requests, குறிப்பிட்ட IP blocks-இலிருந்து வரும் அதிக traffic ஆகியவை security alarm ஆக இருக்கலாம். எனவே SEO மற்றும் system administration குழுக்கள் log data-வை சேர்ந்து மதிப்பிடுவது நல்ல நடைமுறை.

முடிவு: Log Analysis என்பது SEO-வின் உண்மையான Data Layer

சர்வர் லாக் கோப்புகளை ஆய்வு செய்து தேடுபொறி போட்களை கண்காணிப்பது, technical SEO-வில் ஊகத்தின் அடிப்படையிலான முடிவுகளை குறைத்து, உண்மையான crawl behavior-ஐ கண்ணுக்கு தெரியவைக்கிறது. எந்த URL-கள் bot-களால் மதிப்புடன் பார்க்கப்படுகின்றன, எந்த errors bot-களை சோர்வடையச் செய்கின்றன, server எப்போது சுமையைச் சந்திக்கிறது, crawl budget எங்கே வீணாகிறது என்பதைக் log-கள் மூலம் அளவிட முடியும். Regular analysis என்பது வளர்ந்து வரும் தளங்களில் indexing quality மற்றும் organic visibility-ஐ காக்கும் வலுவான பழக்கம்.

சுருக்கமான தொடக்கத்துக்கு, கடந்த 14 நாள் access log file-ஐ download செய்யுங்கள், உண்மையான Googlebot request-களை filter செய்யுங்கள், status code-களையும் URL groups-களையும் பிரித்து பாருங்கள். உங்கள் findings performance, security அல்லது resource தேவை குறித்து சுட்டிக்காட்டினால் infrastructure-ஐ review செய்வது நல்ல அடுத்த படியாக இருக்கும். Hostragons-ன் hosting, VPS, cloud server, domain மற்றும் SSL தீர்வுகளுடன் உங்கள் தளத்தின் technical foundation-ஐ வலுப்படுத்தி, log analysis மூலம் கண்டுபிடித்த மேம்பாடுகளை இன்னும் ஆரோக்கியமான சூழலில் செயல்படுத்தலாம்.

அடிக்கடி கேட்கப்படும் கேள்விகள்

Server log file SEO-க்காக Google Search Console-இல் இருந்து எப்படி வேறுபடுகிறது?

Google Search Console சுருக்கமான மற்றும் Google-ஐ மையமாகக் கொண்ட data தருகிறது; server log file உங்கள் server-க்கு வந்த உண்மையான request-களை URL, time, IP, user-agent, status code அளவில் காட்டுகிறது. அதனால் log analysis என்பது இன்னும் raw, detailed, verifiable data source ஆகும்.

Log analysis-க்கு எத்தனை நாள் data போதுமானது?

பெரும்பாலான website-களுக்கு 14 முதல் 30 நாள் log data நல்ல தொடக்கம். News sites அல்லது அடிக்கடி update ஆகும் project-களில் 3 முதல் 7 நாள் analysis கூட அர்த்தமுள்ளதாக இருக்கும். Seasonal traffic பெறும் தளங்களில் campaign period-களை தனியாக ஆய்வு செய்ய வேண்டும்.

Googlebot உண்மையானதா என்பதை எப்படி அறியலாம்?

User-agent தகவலை மட்டும் நம்பாதீர்கள். IP address-க்கு reverse DNS check செய்யுங்கள், கிடைக்கும் domain name googlebot.com அல்லது google.com-ல் முடிகிறதா என்பதை உறுதிப்படுத்துங்கள், பின்னர் அந்த domain name அதே IP-க்கு மீண்டும் resolve ஆகிறதா என்று பாருங்கள். பொருந்தினால் bot உண்மையானதாக இருக்க வாய்ப்பு அதிகம்.

404 பிழைகள் எப்போதும் SEO பிரச்சினையா?

ஒவ்வொரு 404-மும் பெரிய பிரச்சினை அல்ல; நீக்கப்பட்ட அல்லது ஒருபோதும் இல்லாத pages-க்கு அது இயல்பானதாக இருக்கலாம். ஆனால் முக்கிய internal links-இல் இருந்து வரும், backlink பெற்றிருக்கும், அல்லது Googlebot அடிக்கடி crawl செய்யும் 404 URL-கள் crawl budget-ஐ வீணாக்கலாம். இத்தகைய URL-க்களுக்கு பொருத்தமான redirect அல்லது 410 strategy பற்றி யோசிக்க வேண்டும்.

Log analysis எவ்வளவு அடிக்கடி செய்ய வேண்டும்?

சிறிய தளங்களுக்கு மாதாந்திர analysis போதுமானதாக இருக்கும். பெரிய e-commerce, news மற்றும் அதிக traffic project-களில் வாராந்திரம், முக்கியமான காலங்களில் தினசரி monitoring கூட பரிந்துரைக்கப்படுகிறது. Site migration, infrastructure change அல்லது பெரிய content update பிறகு log check அவசியம் செய்ய வேண்டும்.

இந்தக் கட்டுரையைப் பகிரவும்:

Hostragons குழு

ஹோஸ்டிங், சர்வர்கள் மற்றும் டொமைன் பெயர்கள் குறித்த எங்கள் நிபுணர் குழுவின் சமீபத்திய வழிகாட்டிகள். உங்கள் திட்டத்திற்கான சரியான தீர்வை நாம் இணைந்து கண்டறிவோம்.

எங்களைத் தொடர்பு கொள்ளுங்கள்