直接回答:当站点从几十个页面扩到几百上千个页面后,最不适合继续手工做的是三类工作——逐页改动可模板化的元素、靠人工记忆维持的站内链接与URL规则、以及逐条汇总的抓取与索引数据核对。它们共同的问题是:每一次都要人重复判断,而判断标准本身已经稳定,重复只会带来遗漏和延迟。下面用一个假设情境,把“该不该继续手工做”的决策过程拆开。
假设某海口本地信息类站点,半年内从约80个页面扩到约900个页面,团队有三个人:内容编辑、负责技术的同事、以及对接外部资源的负责人。某次例会讨论“为什么新页面收录变慢”,三个人给出三种说法:编辑认为内容质量没下降,技术认为服务器没问题,负责人认为是对外提交不够勤。三种说法都能自洽,但无法核对,因为没有人手上有可比较的同一份事实。
这时要做的不是继续争论,而是把分歧转成可以核对的项目:把“收录慢”拆成抓取、索引、排名三个不同环节,分别问“哪个环节的数据变了、变了多少、从哪一天开始变”。抓取、索引、排名并不是同一件事,抓取正常不代表索引正常,索引正常也不代表排名会同步变化。这一步的结果会直接决定下一步:如果只是抓取量下降,优先查入口和站内链接;如果抓取正常但索引比例下降,优先查页面本身是否值得被保留。
规模小的时候,手工改标题、描述、面包屑、分页链接是可行的,因为改动次数少、上下文都在脑子里。规模扩大后,这类元素的特点是“规则统一、页面数量大”,继续手工做的代价不是慢,而是不一致。
判断标准可以这样用:如果同一类改动需要重复超过你能一次核对完的数量,并且改动规则可以用一句话说清,就应该走批量或模板层。比如“所有列表分页的第二页以后,标题里不再重复站点名”这种规则,手工改到第一百个页面时,前面改过的和后面改的很可能已经不是一个写法。
实际动作示例:先抽10个同类页面,记录当前写法,写出统一规则,然后用模板或批量方式应用,再抽另外10个页面核对是否与规则一致。核对结果如果出现例外,说明规则本身没写清,应该回到规则这一步,而不是继续手工补漏。这个顺序会影响下一步——规则稳定后才值得投入批量处理,规则不稳就先别铺开。
站内链接和URL规则在小站里常靠“大家都知道”来维持:谁加的链接指向哪里、哪些旧地址做过跳转、哪些栏目用哪种命名,都记在个人经验里。规模扩大后,这种记忆型管理会出现两种典型症状:新页面接不上已有结构,旧地址的跳转关系没人说得清。
要把它变成可核对的项目,可以先把现有URL和跳转关系整理成一份清单,只记录事实:哪些地址存在、指向哪里、是否还有入口。整理过程中如果发现同一个内容存在多个地址,先确认哪个是主要入口,再决定其余地址的处理方式。这里要注意一个常见误判:某个旧地址的访问量归零,不能单独证明它已经没用了,也可能只是入口被撤掉、或者统计本身没覆盖到,需要结合入口和链接关系一起看。
这一步的结果会影响下一步:如果清单显示大量页面只有一条入口链接,那么优先补的是内部链接结构,而不是继续新增页面;如果清单显示大量重复地址,优先处理的是地址统一,而不是继续优化文案。
规模小的时候,人工在后台逐条看哪些页面被抓取、哪些被索引,是能做完的。规模扩大后,逐条核对的真正问题不是工作量,而是“只看到了被列出来的部分”。人工核对天然偏向最近改动过的页面和印象深的页面,容易漏掉那些没人再看的旧页面。
更可行的做法是固定一组核对口径,而不是固定一组页面。比如按栏目分层抽样,每个栏目取固定数量的页面,记录抓取、索引、入口链接三项状态,隔一段时间用同样口径再取一次。两次结果对比,才能看出是整体变化还是个别页面波动。这里同样要避免把相关当因果:某次调整之后数据变了,不等于这次调整导致了变化,还要看同期是否有其他改动、抓取预算是否被别的部分占用。
假设情境里的三个人,如果按这个口径各查一层,就能把“收录慢”落到具体栏目和具体环节上,讨论也从互相说服变成对照同一份记录。
不是所有工作都该自动化。以下情况继续手工做更合理:改动只涉及少量页面且规则还没稳定;需要判断内容方向、选题取舍这类没有统一标准的决策;以及首次验证某个改动是否有效时,先手工做小范围试验,确认方向后再考虑铺开。
区分的关键不是“手工还是工具”,而是“这件事的判断标准是否已经稳定”。标准稳定、重复次数多的,交给模板或批量;标准还在变、需要人做取舍的,留在手工环节。按这个分界重新分配三个人的工作,比笼统地说“要提效”更能落地。