最直接的回答是:凡是需要“逐页重复、结果要一致、出错后难追溯”的环节,都不适合继续手工做。判断标准不是工作量大小,而是这项工作是否依赖人工记忆、是否每次都要重新做一遍判断。内链维护、旧内容批量调整、索引状态巡检、结构化数据一致性检查,这几类会最先触顶。下面用一个你手里已有的页面清单,把它变成可执行的处理方案。
假设你手上有一份从百度专区抓下来的页面清单,字段只有 URL、标题、最后修改时间。规模小时,你可以凭印象决定哪篇该加内链、哪篇该改标题。规模扩大后,问题不在体力,而在于每次判断的依据都留在你脑子里,换个人接手就断档。
可区分的证据是:如果同一类修改在两批页面上给出的标准不一致,说明这项工作已经不适合手工。例如第一批你按“标题是否含核心词”改,第二批又按“点击是否偏低”改,标准漂移本身就是手工处理失控的表现。
此时能执行的最小动作是:在这份清单上新增三列——判断依据、处理动作、复查结果。先只填二十行,看同一判断依据能否覆盖多行。能覆盖,就可以转成规则;不能覆盖,说明还没到批量阶段。这一步不能推出的结论是:填满表格不等于问题解决,它只证明你找到了可复用的判断口径。
内链是规模扩大后最先失控的手工活。手工做法是打开一篇文章,凭感觉挑几个相关页面插进去。规模上来后,你会漏掉大量该连的页面,也会在同一个页面上反复堆链接。
可执行动作:以你清单里的页面标题为对象,先定义两条筛选条件,例如“标题包含同一主题词”和“两页正文有共同出现的实体词”。按条件跑一遍,得到候选链接对,再人工只做一件事——确认这对链接是否对读者有用。
这个动作的结果会直接影响下一步:如果候选对里大部分都成立,说明筛选条件够用,可以扩大到全部页面;如果大部分要否决,说明条件写得太宽,应回到条件本身调整,而不是继续手工逐页补。手工在这里的代价不是慢,而是标准无法沉淀。
网站规模扩大后,旧内容会积累成一批需要统一调整的页面,比如统一补充某段说明、统一替换过时表述、统一调整标题写法。手工逐页改的问题在于,改到一半你会忘记哪些已改。
可执行动作:把清单按“是否需要统一动作”分成两类。需要统一动作的,写出一条明确的替换或补充规则;不需要统一动作的,留在人工队列。前一类交给批量处理,后一类才值得逐页看。
需要说明的适用条件:批量处理只适合规则明确的修改。如果修改涉及语义判断,比如某段话是否还成立,就不能套同一条规则。这里不能推出的结论是:批量改完页面数量增加,不代表搜索表现会同步改善,抓取、索引、排名是不同环节,页面被处理过不等于被重新理解。
规模小时,你可以手动查几个页面是否被收录。规模扩大后,抽查会给你错误的安全感:抽到的正常,不代表没抽到的也正常。
可执行动作:在清单里记录每个页面的当前状态和上次检查时间,按时间排序,优先复查最久未看的页面。这样你得到的是一个可排序的队列,而不是随机抽查。
如果某段时间复查量突然归零,不要直接断定处理正确。合理解释至少有两种:一是这段时间没有新增或变更页面,二是记录环节本身断了。要区分这两种情况,就去看清单里最后修改时间是否有变化。没有变化,归零可能只是没有触发条件。
不是所有工作都该交出去。以下情况手工反而更合适:
在缺少数据或权限时,仍可执行的最小动作是:只处理你清单里已有的字段,不假设看不到的数据。比如只有标题和修改时间,就先按修改时间排序处理最旧的页面,不要推断点击或排名。这样做的结果会告诉你,仅凭现有字段能否支撑判断;如果不能,下一步该补的是数据,而不是加大手工投入。
把这几类工作区分开,你会得到一个清晰的边界:需要逐页重复判断的,转成规则和队列;需要语义判断的,留在人工队列。规模扩大后真正要放弃的不是手工本身,而是没有记录、无法复用的手工。