Robots.txt ਜਨਰੇਟਰ ਅਤੇ ਵੈਲੀਡੇਟਰ ਦੀ ਵਰਤੋਂ ਕਿਉਂ ਕਰੀਏ?
ਇਹ ਟੂਲ ਵੈੱਬ ਕ੍ਰਾਲਰਾਂ (ਜਿਵੇਂ ਕਿ Googlebot) ਲਈ ਨਿਯਮ ਬਣਾਉਣ ਅਤੇ ਉਹਨਾਂ ਦੀ ਜਾਂਚ ਕਰਨ ਵਿੱਚ ਤੁਹਾਡੀ ਮਦਦ ਕਰਦਾ ਹੈ, ਤਾਂ ਜੋ ਉਹ ਤੁਹਾਡੀ ਵੈੱਬਸਾਈਟ 'ਤੇ ਜਾਣ ਵੇਲੇ ਉਹਨਾਂ ਨਿਯਮਾਂ ਦੀ ਪਾਲਣਾ ਕਰ ਸਕਣ। ਤੁਸੀਂ ਵੱਖ-ਵੱਖ ਕ੍ਰਾਲਰਾਂ ਲਈ ਵੱਖ-ਵੱਖ ਨਿਯਮ ਜੋੜ ਕੇ ਇੱਕ robots.txt ਫਾਈਲ ਤਿਆਰ ਕਰ ਸਕਦੇ ਹੋ ਅਤੇ ਫਿਰ ਵੈੱਬਸਾਈਟ ਦੇ ਖਾਸ ਮਾਰਗਾਂ ਦੀ ਜਾਂਚ ਕਰਕੇ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ ਉਹਨਾਂ ਨਿਯਮਾਂ ਦੇ ਅਧਾਰ 'ਤੇ ਕਿਸੇ ਕ੍ਰਾਲਰ ਨੂੰ ਇਜਾਜ਼ਤ ਦਿੱਤੀ ਜਾਵੇਗੀ ਜਾਂ ਬਲੌਕ ਕੀਤਾ ਜਾਵੇਗਾ।
ਇਸ ਟੂਲ ਦੀ ਲੋੜ ਹੇਠ ਲਿਖੇ ਲੋਕਾਂ ਨੂੰ ਹੁੰਦੀ ਹੈ:
- ਵੈੱਬਸਾਈਟ ਦੇ ਰੱਖ-ਰਖਾਅ ਕਰਨ ਵਾਲੇ (Website maintainers) ਜੋ ਇਹ ਨਿਯੰਤਰਿਤ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹਨ ਕਿ ਵੈੱਬ ਕ੍ਰਾਲਰ ਉਹਨਾਂ ਦੀ ਸਾਈਟ ਤੱਕ ਕਿਵੇਂ ਪਹੁੰਚ ਕਰਦੇ ਹਨ।
- ਡਿਵੈਲਪਰ ਜਿਨ੍ਹਾਂ ਨੂੰ robots.txt ਫਾਈਲਾਂ ਬਣਾਉਣ ਜਾਂ ਉਹਨਾਂ ਵਿੱਚ ਸੋਧ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
- ਕੋਈ ਵੀ ਅਜਿਹਾ ਵਿਅਕਤੀ ਜੋ ਕ੍ਰਾਲਰਾਂ ਨੂੰ ਆਪਣੀ ਵੈੱਬਸਾਈਟ ਦੇ ਖਾਸ ਹਿੱਸਿਆਂ ਤੱਕ ਪਹੁੰਚਣ ਤੋਂ ਰੋਕਣਾ ਚਾਹੁੰਦਾ ਹੈ।
- ਉਹ ਉਪਭੋਗਤਾ ਜੋ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਚਾਹੁੰਦੇ ਹਨ ਕਿ ਮਹੱਤਵਪੂਰਨ ਪੇਜ ਗਲਤੀ ਨਾਲ ਕ੍ਰਾਲਰਾਂ ਤੋਂ ਬਲੌਕ ਨਾ ਹੋ ਜਾਣ।
ਇਨਪੁਟਸ ਅਤੇ ਆਉਟਪੁਟਸ ਦੀ ਸਮਝ
ਟੂਲ ਨੂੰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਚਲਾਉਣ ਲਈ ਹੇਠਾਂ ਦਿੱਤੇ ਇਨਪੁਟਸ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ:
- ਯੂਜ਼ਰ-ਏਜੰਟ (User-agent): ਇੱਕ ਕ੍ਰਾਲਰ ਦਾ ਨਾਮ, ਜਾਂ ਸਾਰੇ ਕ੍ਰਾਲਰਾਂ ਲਈ
*। - ਮਾਰਗ (Path): ਵੈੱਬਸਾਈਟ ਦਾ ਇੱਕ ਮਾਰਗ, ਜੋ ਕਿ
/ਨਾਲ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। - ਸਾਈਟਮੈਪ URL: ਇੱਕ ਸਾਈਟਮੈਪ ਲਈ ਪੂਰਾ
http://ਜਾਂhttps://ਪਤਾ। - URL ਮਾਰਗ: ਜਾਂਚ ਕਰਨ ਲਈ ਤੁਹਾਡੀ ਵੈੱਬਸਾਈਟ ਦਾ ਇੱਕ ਖਾਸ ਮਾਰਗ।
- ਕ੍ਰਾਲਰ: ਉਹ ਕ੍ਰਾਲਰ ਜਿਸ ਦੇ ਵਿਰੁੱਧ ਕਿਸੇ ਮਾਰਗ ਦੀ ਜਾਂਚ ਕਰਨੀ ਹੈ।
ਇਸ ਦੇ ਬਦਲੇ ਵਿੱਚ, ਟੂਲ ਹੇਠ ਲਿਖੇ ਆਉਟਪੁਟਸ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ:
- ਤਿਆਰ ਕੀਤੀ ਗਈ robots.txt: robots.txt ਫਾਈਲ ਦਾ ਇੱਕ ਪੂਰਵ-ਦਰਸ਼ਨ।
{count}ਨਿਯਮ: ਤਿਆਰ ਕੀਤੀ ਗਈ robots.txt ਵਿੱਚ ਨਿਯਮਾਂ ਦੀ ਕੁੱਲ ਸੰਖਿਆ।- ਸਮੀਖਿਆ ਕਰਨ ਲਈ
{count}ਆਈਟਮਾਂ ਹਨ: ਨਿਯਮਾਂ ਵਿੱਚ ਮਿਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਦੀ ਸੰਖਿਆ। - ਇਜਾਜ਼ਤ ਹੈ —
{rule}: ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਟੈਸਟ ਕੀਤੇ ਗਏ ਮਾਰਗ ਦੀ ਇਜਾਜ਼ਤ ਹੈ ਅਤੇ ਉਹ ਨਿਯਮ ਜੋ ਇਸਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। - ਬਲੌਕ ਕੀਤਾ ਗਿਆ —
{rule}: ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਟੈਸਟ ਕੀਤਾ ਗਿਆ ਮਾਰਗ ਬਲੌਕ ਹੈ ਅਤੇ ਉਹ ਨਿਯਮ ਜੋ ਇਸਨੂੰ ਬਲੌਕ ਕਰਦਾ ਹੈ। - ਕੋਈ ਮੇਲ ਖਾਂਦਾ ਨਿਯਮ ਨਹੀਂ ਹੈ। Google ਮੂਲ ਰੂਪ ਵਿੱਚ ਇਸ ਮਾਰਗ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।: ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਟੈਸਟ ਕੀਤੇ ਗਏ ਮਾਰਗ 'ਤੇ ਕੋਈ ਨਿਯਮ ਲਾਗੂ ਨਹੀਂ ਹੁੰਦਾ।
ਨਿਯਮ ਅਤੇ ਵਿਸ਼ੇਸ਼ ਸਥਿਤੀਆਂ (Edge Cases)
robots.txt ਫਾਈਲ ਬਣਾਉਂਦੇ ਸਮੇਂ ਕੁਝ ਖਾਸ ਨਿਯਮਾਂ ਅਤੇ ਸਥਿਤੀਆਂ ਦਾ ਧਿਆਨ ਰੱਖਣਾ ਜ਼ਰੂਰੀ ਹੈ:
- ਇਹ ਟੂਲ ਮੂਲ ਰੂਪ ਵਿੱਚ
User-agent: *ਅਤੇDisallow: /adminਨਾਲ ਸ਼ੁਰੂ ਹੁੰਦਾ ਹੈ। - ਯੂਜ਼ਰ-ਏਜੰਟ ਦੇ ਨਾਮ ਵਿੱਚ ਕੋਈ ਖਾਲੀ ਥਾਂ (space) ਨਹੀਂ ਹੋ ਸਕਦੀ।
- ਨਿਯਮ ਦੇ ਮਾਰਗ
/ਨਾਲ ਸ਼ੁਰੂ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ ਅਤੇ ਇਹਨਾਂ ਵਿੱਚ ਕੋਈ ਖਾਲੀ ਥਾਂ ਨਹੀਂ ਹੋ ਸਕਦੀ। $ਅੱਖਰ ਦੀ ਵਰਤੋਂ ਸਿਰਫ਼ ਨਿਯਮ ਦੇ ਮਾਰਗ ਦੇ ਅੰਤ ਵਿੱਚ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ।- ਜੇਕਰ ਇੱਕੋ ਯੂਜ਼ਰ-ਏਜੰਟ ਲਈ ਕੋਈ ਨਿਯਮ ਦੁਹਰਾਇਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸਨੂੰ "ਇਹ ਨਿਯਮ ਉਸੇ ਯੂਜ਼ਰ-ਏਜੰਟ ਲਈ ਦੁਹਰਾਇਆ ਗਿਆ ਹੈ।" ਵਜੋਂ ਫਲੈਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
- ਜੇਕਰ Allow ਅਤੇ Disallow ਨਿਯਮ ਇੱਕੋ ਮਾਰਗ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਤਾਂ ਇਸਨੂੰ "Allow ਅਤੇ Disallow ਇੱਕੋ ਮਾਰਗ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਦੋਵੇਂ ਬਰਾਬਰ ਵਿਸ਼ੇਸ਼ ਹੋਣ ਤਾਂ Google 'Allow' ਨੂੰ ਲਾਗੂ ਕਰਦਾ ਹੈ।" ਵਜੋਂ ਫਲੈਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
- ਜੇਕਰ ਇੱਕੋ ਯੂਜ਼ਰ-ਏਜੰਟ ਨੂੰ ਕਈ ਗਰੁੱਪਾਂ ਵਿੱਚ ਨਾਮਜ਼ਦ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸਨੂੰ "Google ਉਹਨਾਂ ਗਰੁੱਪਾਂ ਨੂੰ ਜੋੜਦਾ ਹੈ ਜੋ ਇੱਕੋ ਯੂਜ਼ਰ-ਏਜੰਟ ਦਾ ਨਾਮ ਦਿੰਦੇ ਹਨ।" ਵਜੋਂ ਫਲੈਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
- ਸਾਈਟਮੈਪ URL ਪੂਰੇ
http://ਜਾਂhttps://ਪਤੇ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ। - ਜੇਕਰ ਤਿਆਰ ਕੀਤੀ ਗਈ robots.txt 100,000 ਅੱਖਰਾਂ (characters) ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਇਸਨੂੰ "ਇਹ robots.txt ਇੱਥੇ ਸਮੀਖਿਆ ਕਰਨ ਲਈ ਬਹੁਤ ਵੱਡੀ ਹੈ।" ਵਜੋਂ ਫਲੈਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
Google ਦੇ ਨਿਯਮਾਂ ਦੇ ਮੇਲ ਖਾਣ ਦਾ ਕ੍ਰਮ
ਜਦੋਂ ਮਾਰਗਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਇਹ ਟੂਲ Google ਦੇ ਮੇਲ ਖਾਣ ਦੇ ਕ੍ਰਮ (matching order) ਦਾ ਪਾਲਣ ਕਰਦਾ ਹੈ:
- ਸਭ ਤੋਂ ਲੰਬਾ ਮੇਲ ਖਾਂਦਾ ਮਾਰਗ ਹਮੇਸ਼ਾ ਜਿੱਤਦਾ ਹੈ।
- ਜੇਕਰ ਮੇਲ ਖਾਂਦੇ Allow (ਇਜਾਜ਼ਤ ਦਿਓ) ਅਤੇ Disallow (ਇਜਾਜ਼ਤ ਨਾ ਦਿਓ) ਨਿਯਮ ਬਰਾਬਰ ਵਿਸ਼ੇਸ਼ ਹਨ, ਤਾਂ Allow ਨਿਯਮ ਜਿੱਤਦਾ ਹੈ।
ਇਹ ਸਮਝਣਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿ robots.txt ਦੀਆਂ ਆਪਣੀਆਂ ਸੀਮਾਵਾਂ ਹਨ। ਇੱਕ ਬਲੌਕ ਕੀਤਾ ਗਿਆ ਪੇਜ ਅਜੇ ਵੀ ਖੋਜ ਨਤੀਜਿਆਂ ਵਿੱਚ ਦਿਖਾਈ ਦੇ ਸਕਦਾ ਹੈ ਜੇਕਰ ਹੋਰ ਪੇਜ ਇਸ ਨਾਲ ਲਿੰਕ ਕਰਦੇ ਹਨ। ਇਹ ਟੂਲ noindex, ਪਹੁੰਚ ਨਿਯੰਤਰਣ (access control), ਜਾਂ ਪੇਜ ਨੂੰ ਹਟਾਉਣ ਦੀ ਜਾਂਚ ਨਹੀਂ ਕਰਦਾ ਹੈ।
ਗੋਪਨੀਯਤਾ ਅਤੇ ਡਾਟਾ ਪ੍ਰੋਸੈਸਿੰਗ
ਤੁਹਾਡੀ ਸੁਰੱਖਿਆ ਅਤੇ ਗੋਪਨੀਯਤਾ ਸਾਡੇ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਤੁਹਾਡੇ ਕ੍ਰਾਲ ਨਿਯਮ ਤੁਹਾਡੇ ਬ੍ਰਾਊਜ਼ਰ ਵਿੱਚ ਬਣਾਏ ਅਤੇ ਚੈੱਕ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। BroBroGo 'ਤੇ ਕੁਝ ਵੀ ਅੱਪਲੋਡ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ।
ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਸਵਾਲ (FAQ)
ਇਹ ਜਨਰੇਟਰ robots.txt ਵਿੱਚ ਕੀ ਜੋੜ ਸਕਦਾ ਹੈ?
ਇੱਕ ਯੂਜ਼ਰ-ਏਜੰਟ ਗਰੁੱਪ, Allow ਅਤੇ Disallow ਮਾਰਗ, ਅਤੇ ਇੱਕ ਜਾਂ ਵੱਧ ਸਾਈਟਮੈਪ URL ਜੋੜੋ। ਪੂਰਵ-ਦਰਸ਼ਨ (preview) robots.txt ਫਾਈਲ ਵਿੱਚ ਕਾਪੀ ਕਰਨ ਲਈ ਤਿਆਰ ਹੈ।
ਮਾਰਗ ਜਾਂਚਕਰਤਾ (path checker) ਕਿਸੇ ਨਿਯਮ ਨੂੰ ਕਿਵੇਂ ਚੁਣਦਾ ਹੈ?
ਇਹ Google ਦੇ ਮੇਲ ਖਾਣ ਦੇ ਕ੍ਰਮ ਦਾ ਪਾਲਣ ਕਰਦਾ ਹੈ: ਸਭ ਤੋਂ ਲੰਬਾ ਮੇਲ ਖਾਂਦਾ ਮਾਰਗ ਜਿੱਤਦਾ ਹੈ। ਜੇਕਰ ਮੇਲ ਖਾਂਦੇ Allow ਅਤੇ Disallow ਨਿਯਮ ਬਰਾਬਰ ਵਿਸ਼ੇਸ਼ ਹਨ, ਤਾਂ Allow ਜਿੱਤਦਾ ਹੈ।
ਕੀ Disallow ਕਿਸੇ ਪੇਜ ਨੂੰ Google ਖੋਜ ਤੋਂ ਹਟਾ ਦਿੰਦਾ ਹੈ?
ਨਹੀਂ। ਇੱਕ ਬਲੌਕ ਕੀਤਾ ਗਿਆ ਪੇਜ ਅਜੇ ਵੀ ਖੋਜ ਨਤੀਜਿਆਂ ਵਿੱਚ ਦਿਖਾਈ ਦੇ ਸਕਦਾ ਹੈ ਜੇਕਰ ਹੋਰ ਪੇਜ ਇਸ ਨਾਲ ਲਿੰਕ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਤੁਸੀਂ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਪੇਜ ਖੋਜ ਤੋਂ ਬਾਹਰ ਰਹੇ, ਤਾਂ noindex, ਪਹੁੰਚ ਨਿਯੰਤਰਣ (access control) ਦੀ ਵਰਤੋਂ ਕਰੋ, ਜਾਂ ਪੇਜ ਨੂੰ ਹਟਾ ਦਿਓ।