ITSWE博客

百度只抓不收:一次完整的取证式诊断

四千五百条蜘蛛日志的全量取证:蜘蛛真伪、配额经济学、模板页的宿命,以及一次被自己推翻的建议。

症状很简单:百度的索引量长期不动,抓取看起来也在发生,就是不进索引。抱怨没有用,我们把日志翻了个底朝天——十三天、四千五百多条百度蜘蛛记录,全量取证。这篇记录完整的诊断方法与结论。

第一步:证明蜘蛛是真的

取证的第一课是字段纪律。访问日志是自定义格式,来源地址藏在第八段——而更早的一次分析取错了字段,把浏览器标识当成了地址,得出“蜘蛛全是假的”的错误结论,这次全量重验才算翻案:对每条可疑记录做两步反向解析,先查地址的反解记录,再正向解析回来比对,两步都对得上,才是真蜘蛛。结论:蜘蛛是真的,而且全是正牌网段。

这次翻案让“先验证字段、再看结论”成为日志分析的铁律。结论的错误,九成来自输入的错误;输入的错误,九成来自想当然的字段序号。

第二步:量化抓取行为

全量统计给出了冷酷的画像。总量:十三天四千五百条,平均一天三百多;分布:极端脉冲式——爆发日两千多条,平峰日零到五条。深度:十三天里只抓了七次站点地图,而谷歌同期抓了三十四次,且每天稳定抓三十到一百八十条页面。

也就是说,百度给这座新站的预算,是每天几百次配额、脉冲式投放、站点地图通道近乎不看。在这个预算里,它抓了一千零九十六个去重后的题目页。

第三步:回答核心问题——抓了为什么没收

用引号精确搜索真实题干,百度和谷歌都是零命中——抓而不收,两家一致。这就排除了“百度针对性打压”的阴谋论,指向结构性原因。对比两类页面的内容量:题目页九百一十三字,全部来自固定模板(题干加选项加答案);已收录的百科长文六千多字,原创成文。同一座站,在引擎眼里是两种东西:前者是低质模板的温床,后者才是内容。

根因排序随之清晰:模板化短页被判低质(主因,全引擎一致);发现通道收窄(推送主动排除了题页、站点地图通道被刻意设防,这是当初为保护配额的刻意设计);新站冷启动零外链;海外主机的官方不利因子。

第四步:决策与自我推翻

诊断产出建议时,出现了这次诊断最有价值的瞬间。上午顺着惯性写了一条:放开对蜘蛛的某条目录限制,恢复一条被挡住的地图通道。晚上复审时发现,这条建议的语境已经反转——那条限制是数日前刻意设计的防线,目的就是不让九千个模板页去烧每天十个的推送配额;放开它的唯一效果,是把已判定低质的页面重新喂给引擎。裁决:拒绝,留档,标注“语境已反转,勿执行”。

同一份诊断,上午和晚上给出相反的执行建议——不是诊断变了,是防线的设计意图只有写的人知道。过期建议比没有建议更危险,所以每条建议都要写清它的前提语境。

配额经济学

诊断把百度的配额机制摸了个透,值得单讲。平台给的普通收录配额是每天十条,实操留一条余量、推九条。这九条怎么花,是个投资问题:站内待推的存量有近千条,按九条一天要推一百多天——顺序就是策略。我们的优先级是首页与顶级栏目最先(一次性建立站点骨架的认知),详情页按重要性轮换,已推送过的按最久未推轮换复推保持新鲜度。每条推送的状态与时间都落在一个状态文件里,防止重复消耗配额。

另一个关键决策是主动把题库页面排除出推送池。道理在前面讲过:九千个模板页送去只会确认低质印象。这是一个反直觉但正确的动作——推送配额的经济学里,推一条低质页的成本不是零,是“占用一条名额且拉低站内内容的平均质量画像”。

站点地图通道同理。robots 规则里对百度的地图访问做了刻意设防:只放行一份手工维护的扁平地图,索引型地图与子表一律不给。这份扁平图只包含经过筛选的内容页。给不同引擎看不同的菜单听起来像黑魔法,其实是配额紧张时的正常资源分配——谷歌预算充足,全量地图随便抓;百度预算金贵,只喂验证过能收的。

点击数据回读

诊断的最后一步是回读真实点击:近八天从百度过来的点击共三十次,分布是标准卡十二次、百科长文十一次、首页五次、考试级页一次、计算器一次、题目页零次。这组数字给战略提供了最硬的支撑——投入产出现状一目了然:标准卡和长文是被验证的价值点,题目页连点击都没有,更遑论收录。后续的内容投入因此向标准卡和长文倾斜,这比任何猜测都可靠。

终局与转机

最终战略:接受题页不进索引的现实(谷歌也一样),把推送预算全部投给被验证能收的六千字长文;题目页的差异化靠补充考点链接、标准依据和解析扩写,攒够质量再谈收录。近八天的真实点击数据支持这个判断:三十次点击里,标准卡十二次、百科十一次,题目页零次。

几周后的复查出现了转机迹象:谷底回升,从每天十几次爬回几十次,而且抓的内容正是题库和标准词条——我们希望它抓的。低迷期的坚持等来了方向正确的斜率。

方法论沉淀成三句话:日志取证,先验证字段;配额是稀缺资源,要像花钱一样花它;以及,诊断报告的每条建议都要带前提,前提变了,结论就得重审。

SEO数据
返回全部文章