判断网站挂马检测的数据量是否够用,不看日志攒了多少天,而看这些数据能否覆盖“谁在何时通过哪个入口改动了什么”这条证据链。只要链上有一环缺失,再大的数据量也不能支撑定位,反而会让人误以为已经查清。
很多人把挂马检测等同于“留存全部访问日志”,认为数据量越大越有把握。实际判断标准是覆盖率而非体积。假设一个站点每天只有几十条访问记录,但完整保留了文件修改时间、进程调用和上传接口请求,这份数据量很小,却可能足够定位。反过来,一个日访问量很大的站点若只留下访问日志,没有文件变更记录,数据量再大也无法回答“木马是什么时候被写进去的”。
数据量够用的前提是:它包含与挂马写入动作直接相关的字段,而不是包含尽可能多的无关请求。
挂马通常通过上传漏洞、弱口令后台、被窃取的凭据或第三方组件缺陷写入文件。要判断数据够不够,逐项核对以下环节是否有记录:
这五项里缺哪一项,就说明对应环节的数据量不足。例如只有访问日志,无法区分是正常用户请求还是攻击载荷;只有文件时间,无法知道是哪个进程写的。
用一次具体排查来检验数据量。先选一个已确认被篡改的文件,记录它的修改时间,然后按时间窗口去查:
如果能在至少两个独立来源中还原出同一条时间线,数据量对这次定位就是够用的。如果只能看到文件时间,其余环节都查不到,说明数据量不足,需要先补齐采集项,而不是继续扩大存储。
站内访问统计、服务器原始日志和第三方估算流量的口径不同。站内统计可能经过采样或过滤,第三方估算只是推测,二者都不能替代服务器原始日志用于挂马取证。判断数据是否够用时,应以服务器端可验证的原始记录为准,并明确每条记录的时区与时间格式,避免因时区偏差把不同事件错判为同一时刻。
当数据能回答三个问题,就可以判定够用:木马文件何时出现、由哪个入口写入、写入者使用了什么凭据或路径。若三个问题中有任何一个无法回答,就属于数据量或字段不足。此时正确的下一步不是继续堆积日志,而是先补上缺失的采集项,再重新做一次同样的时间线还原。
下一步建议:挑一个已确认被篡改的文件,按上面的五个环节做一次时间线还原。能还原到两个独立来源,就说明当前数据够用;还原不到,就记录下缺失的环节,作为补充采集的依据。