建站日志 09-13:百度给的下马威
诊断日:蜘蛛是真的,配额是 9 条/天,题页抓而不收。以及,上午的结论被晚上的自己否决。
今天全部给了百度。起因是索引量一直不动,决定把日志翻个底朝天。
先纠正一个旧结论。之前分析日志时下过“百度蜘蛛全是假的”判断,这次逐条反查发现——是取错了字段,把浏览器标识那一列当成了来源 IP。重新用正确字段验证:真实百度蜘蛛,反向解析两步全过。一个字段之差,结论完全反转。这件事被记成了铁律:判读日志,先验证字段对不对,再看结论顺不顺。
诊断结果摆出来,比想象的更冷酷。百度每天的有效抓取个位数,还呈脉冲式;抓到的九千多个题目页,一条都没收——而且谷歌同样不收。对比之下,wiki 上几千字的原创长文收得很正常。根因清楚了:不是针对我们,是模板化的短页面天生不受索引待见,哪个引擎都一样。
还有个数字让人清醒:平台每天只给 10 条推送配额,题目页还得主动排除出去,不能拿低质页面去烧配额。
最有意思的是下午和晚上的自己打架。上午诊断完,顺着惯性提了条建议“把某个目录的抓取限制放开”。晚上复审时发现这条建议的语境早就反转了——当初的限制是刻意设计,不是事故;放开等于把九千个不收录的页面重新喂给百度烧配额。裁决:拒绝,留档,标注“勿执行”。
搜索引擎优化这行,最贵的是拿旧地图走新路。同一天里推翻自己,总好过一个月后被现实推翻。