📰 路透社與《時代》率先設AI爬蟲「預設封鎖」機制
出版商聯盟致函Common Crawl施壓
🤖 AI模型恐面臨數據荒 AI生成答案質素或受牽連
國際主要傳媒機構近月相繼收緊人工智能(AI)爬蟲程式存取旗下網站內容的權限,路透社(Reuters)及《時代雜誌》(Time)率先改用「預設封鎖」模式,未經批准的AI爬蟲一律不得存取內容,情況反映傳媒業界對AI公司未經授權採用其新聞內容訓練 AI 模型的不滿持續升溫。
🔒 傳媒改採「預設封鎖」策略
路透社與《時代雜誌》已於今年五月改變網站爬蟲政策,由過往「發現有問題才封鎖」,轉為「預設全面封鎖」,只有列入白名單(Allowlist)的爬蟲程式方可存取內容。目前路透社網站的robots.txt文件已列明,只有亞馬遜、Google、Bing及OpenAI等公司的爬蟲獲批准存取,公司會視乎爬蟲程式能否提供版權授權、流量或變現等「合理價值交換」而決定是否放行。
⚖️ 出版商聯盟向Common Crawl發律師信
美國出版商行業組織「數碼內容下一代」(Digital Content Next,簡稱DCN)今年六月三日已向Common Crawl發出律師信,要求對方立即停止抓取其會員內容,並刪除資料庫內已儲存的相關內容。Common Crawl是一個非牟利組織,自2007年起每月免費爬取並公開發布大量網頁存檔,供研究及AI公司訓練語言模型使用。DCN行政總裁Jason Kint批評現時「選擇退出」機制不足,質疑Common Crawl過往處理刪除要求時未夠徹底。
📈 業界解讀:內容取用成本上升
業內分析認為,隨著愈來愈多主要傳媒機構收緊AI存取權限,未來AI系統要取得高質素新聞內容的成本將持續上升,AI生成答案亦可能更依賴已與相關機構達成授權協議的內容來源。
有評論指出,此舉反映傳統媒體正嘗試收回內容的知識產權控制權,另一邊箱,規模較小或未具權威性的內容供應者卻可藉此突圍而出,建議將資源投放再Answer Engine Optimization (AEO) 策略上,藉以提升在AI答案中的引用頻率來其增加競爭力。
✅ 強化內容可信度與建立私域流量
面對AI存取收緊,數碼營銷業界普遍建議企業首先強化內容的專業權威度(E-E-A-T),讓網站成為AI值得引述的可信來源;其次應製作具結構化數據標註的問答內容,方便AI爬取及理解,藉此提升被引用的機會。
企業亦應建立自有私域流量,例如電子報或會員制,減少過度依賴搜尋引擎導流的風險,同時留意本地化內容,包括提供繁體中文資訊及本地案例,以提升在AI平台上的曝光及可信度。
————
👇 相信「AI × 數碼營銷」是未來的你,
歡迎 Tag 一位同行好友,一起成長!
#AIMarketerHK #DigitalMarketing #seo #aeo
