robots.txt是什么?
robots.txt是什么?
有沒(méi)有想過(guò),如果我們某個(gè)站點(diǎn)不讓百度和google收錄,那怎么辦?
搜索引擎已經(jīng)和我們達成一個(gè)約定,如果我們按約定那樣做了,它們就不要收錄。
這個(gè)寫(xiě)約定的的文件命名為:robots.txt。
robots.txt是一個(gè)最簡(jiǎn)單的.txt文件,用以告訴搜索引擎哪些網(wǎng)頁(yè)可以收錄,哪些不允許收錄。
關(guān)于robots.txt一般站長(cháng)需要注意以下幾點(diǎn):
如果你的站點(diǎn)對所有搜索引擎公開(kāi),則不用做這個(gè)文件或者robots.txt為空就行。西安網(wǎng)站建設推薦閱讀>>> robots.txt 文件應放在哪里?
必須命名為:robots.txt,都是小寫(xiě),robot后面加"s"。
robots.txt必須放置在一個(gè)站點(diǎn)的根目錄下。如:通過(guò)http://www.seowhy.com/robots.txt 可以成功訪(fǎng)問(wèn)到,則說(shuō)明本站的放置正確。
一般情況下,robots.txt里只寫(xiě)著(zhù)兩個(gè)函數:User-agent和 Disallow。
觀(guān)察這個(gè)頁(yè)面并修改為自己的:http://www.seowhy.com/robots.txt
有幾個(gè)禁止,就得有幾個(gè)Disallow函數,并分行描述。
至少要有一個(gè)Disallow函數,如果都允許收錄,則寫(xiě): Disallow: ,如果都不允許收錄,則寫(xiě):Disallow: / (注:只是差一個(gè)斜桿)。西安網(wǎng)站建設推薦閱讀>>> 使用robots.txt引導百度爬蟲(chóng)合理分配抓取資源,
補充說(shuō)明:
User-agent: * 星號說(shuō)明允許所有搜索引擎收錄
Disallow: /search.html 說(shuō)明 http://www.seowhy.com/search.html 這個(gè)頁(yè)面禁止搜索引擎抓取。
Disallow: /index.php? 說(shuō)明類(lèi)似這樣的頁(yè)面http://www.seowhy.com/index.php?search=%E5%A5%BD&action=search&searchcategory=%25 禁止搜索引擎抓取。
相關(guān)文章:
-
User-agent: * Disallow: / Allow: /complain/ Allow: /media_partners/ Allow: /about/ Allow: /user_agreement/ User-agent: ByteSpider Allow: / User-agent: ToutiaoSpider Allow: / 以上是今日頭條的robots.txt,禁止所有搜索引擎收錄,同時(shí)又...
-
有同學(xué)問(wèn)百度站長(cháng)學(xué)院一個(gè)關(guān)于robots的問(wèn)題:我們有個(gè)站點(diǎn)的目錄結構使用的是中文,這樣式兒的:www.a.com/冒險島/123.html,那在制作robots文件和sitemap文件的時(shí)候,可以直接使用中文嗎?百度能...
-
robots文件是搜索生態(tài)中很重要的一個(gè)環(huán)節,同時(shí)也是一個(gè)很細節的環(huán)節。很多站長(cháng)同學(xué)在網(wǎng)站運營(yíng)過(guò)程中,很容易忽視r(shí)obots文件的存在,進(jìn)行錯誤覆蓋或者全部封禁robots,造成不必要損失! 那...
-
目前百度圖片搜索也使用了與百度網(wǎng)頁(yè)搜索相同的spider,如果想禁止Baiduspider抓取網(wǎng)站上所有圖片、禁止或允許Baiduspider抓取網(wǎng)站上的某種特定格式的圖片文件可以通過(guò)設置robots實(shí)現:西安廣告...
-
對于百度搜索引擎來(lái)說(shuō),蜘蛛黑洞特指網(wǎng)站通過(guò)極低的成本制造出大量參數過(guò)多、內容類(lèi)同但url不同的動(dòng)態(tài)URL ,就像一個(gè)無(wú)限循環(huán)的黑洞,將spider困住。spider浪費了大量資源抓取的卻是無(wú)效網(wǎng)...
-
robots是站點(diǎn)與spider溝通的重要渠道,站點(diǎn)通過(guò)robots文件聲明該網(wǎng)站中不想被搜索引擎收錄的部分或者指定搜索引擎只收錄特定的部分。請注意,僅當您的網(wǎng)站包含不希望被搜索引擎收錄的內容...
-
親愛(ài)的網(wǎng)站管理員, 很高興的告訴大家,百度站長(cháng)平臺 robots 工具全新升級,升級后能夠實(shí)時(shí)查看網(wǎng)站在百度中已生效的的robots文件,并支持對robots進(jìn)行語(yǔ)法及邏輯校驗,有助于站長(cháng)更清晰的...
-
資料一 1.robots.txt文件是什么 robots.txt是一個(gè)純文本文件,是搜索引擎中訪(fǎng)問(wèn)網(wǎng)站的時(shí)候要查看的第一個(gè)文件。robots.txt文件告訴蜘蛛程序在服務(wù)器上什么文件是可以被查看的。每個(gè)站點(diǎn)最好建立...
-
robots.txt文件包含一條或更多的記錄,這些記錄通過(guò)空行分開(kāi)(以CR,CR/NL, or NL作為結束符),每一條記錄的格式如下所示: field:optional spacevalueoptionalspace 在該文件中可以使用#進(jìn)行注解,具體使...
-
搜索引擎通過(guò)一種程序robot(又稱(chēng)spider),自動(dòng)訪(fǎng)問(wèn)互聯(lián)網(wǎng)上的網(wǎng)頁(yè)并獲取網(wǎng)頁(yè)信 息。您可以在您的網(wǎng)站中創(chuàng )建一個(gè)純文本文件robots.txt,在這個(gè)文件中聲明該網(wǎng)站中不想被robot 訪(fǎng)問(wèn)的部分,這...