AI / GEO
内容分块可提取性分析工具
AI答案引擎和RAG系统并不会读完你的整个页面——它们每次只检索一个片段(chunk)并单独展示。这个工具用同样的方式拆分你的内容,并为每个片段打分,判断它在没有周围上下文的情况下是否依然讲得通。
这些启发式规则针对英文文本调校;字数统计和结构检测对其他拉丁字母语言依然有效,但代词和短语检查是英文专属的。
这个工具检查什么
AI Overviews、ChatGPT、Perplexity以及基于RAG的搜索,底层原理其实一样:把页面拆成若干片段(chunk),分别存储,检索时只取能回答查询的一两个片段——页面其余部分永远不会展示给模型。如果某个片段依赖页面前文提到的内容、从半句话开始、或使用了未解释的缩写,即使整页文字写得完美,这个片段在检索环节也会让人困惑甚至被丢弃。这个工具重建了这一分块过程,并对每个生成的片段的独立完整性打分。
分块如何构建与打分
一切都来自你粘贴的原文本身——按照带标题感知的处理流程进行拆分(每块大约150-240个单词,优先在标题处断开)。
基于标题的分块
段落会归类到最近的标题下,组成约150-240个单词的片段。超过这个长度的单个段落会被单独标记,因为自动分块器在其内部找不到自然的断点。
独立完整性检查
每个片段的开头句会被检查是否以悬空代词("This"、"It"、"They"……)开头且在本片段内找不到指代对象,全文还会扫描"如上所述"这类只有在能看到前一个片段时才成立的回指短语。
跨片段缩写追踪
整篇文档中的每个缩写都会被追踪。如果在一个片段中给出了全称,却在另一个片段中未加解释地重复使用,第二个片段会被标记——检索系统会单独展示它,而没有那个定义。
长度与半途中断检测
少于40个单词的片段通常太单薄,无法承载一个完整的观点;以冒号或连接词("……and"、"……because")结尾的片段,对只看到这一段的人来说会显得话没说完。
常见问题
这和可读性或关键词密度检测工具一样吗?
不一样。可读性衡量的是人类能否舒适地阅读文本;这个工具衡量的是单独展示、脱离整个页面的一个片段是否依然讲得通——这是一个不同的问题,只因AI答案引擎会检索并单独展示孤立片段才变得重要。
什么样的片段算"可放心引用"?
每个片段从100分开始,按发现的问题扣分(悬空代词这类严重问题扣分比行文过长这类轻微问题多)。得分达到80分且没有严重问题时,会被标记为可放心引用。
我的内容人类读起来没问题——为什么片段会被标记?
整页读起来没问题,是因为人类会自动在段落之间保持上下文。检索系统不会:它单独存储和展示一个片段,所以任何依赖前一句、前一个片段或前面定义的内容,即使整页写得很好,也可能在悄无声息中失效。
这个工具会把我的文本发送到别处吗?
你粘贴的文本会通过HTTPS发送一次到我们的服务器,用于执行分块与打分(需要在服务器端保持逻辑一致),处理完成后不会被存储。