AI最先解决的是整理问题
长时间运行会产生大量重复日志,人工逐行阅读容易忽略集中出现的时间段。AI可以按错误类型、设备和版本形成摘要。
摘要必须保留到原始记录的对应关系。无法回到原文的结论,很难用于排查。
时间轴先于异常标签
设备日志、路由记录和目标服务可能使用不同的时区或时间精度。时间没有对齐,相关事件会被错误地分开。
分析前统一时区,并保留原始时间字段。夏令时、休眠恢复和设备时钟漂移也要注明。
聚类不是原因证明
模型能发现某类错误经常与连接中断同时出现,但这种相关性不等于错误就是根因。
应设计能够区分不同解释的复查,例如保持任务不变,只切换网络或客户端版本。
正常样本决定异常含义
没有平常运行资料时,模型只能找出彼此不同的记录,不能判断哪一种状态真正异常。
至少保留稳定时期、晚高峰和版本升级前后的样本,异常阈值才有现实参照。
输入清理不能删除语境
密码、令牌、个人资料和未授权文件必须移除,但设备类型、版本、任务名称和时间不能一并删掉。
好的脱敏策略应替换身份字段,同时保留分析所需的关系。
版本比较比单次诊断可靠
客户端或系统升级后出现大量新错误,可以先比较升级前后的错误分布与任务完成率。
若错误增加但完成率不变,可能只是日志粒度改变;若恢复时间同步变长,才需要优先处理。
最后判断仍需现场验证
AI输出适合形成待验证假设、排序检查重点和生成时间摘要,不适合直接宣布网络、设备或服务已经故障。
操作人员要回到实际任务复现,并记录哪些条件支持结论、哪些部分仍然未知。
AI日志摘要如何落地
一份好的AI摘要不是把错误代码换成更长的话,而是指出异常集中在哪些设备、版本和时段。每条结论都应能回到原始日志,否则无法交给工程师复现。
中国机器人团队开始管理更多真实现场后,日志会同时来自边缘计算机、机器人控制器、视觉模型和云端任务。统一设备标识与时间轴,比过早导入复杂模型更重要。
对敏感日志做分析时,账号、令牌和个人资料应该在上传前移除。但设备类型、固件版本、任务阶段和异常时间必须保留,否则模型得到的只是没有语境的文本。
最后的处理应该是一个可验证的假设,例如“某版本在网络切换后恢复更慢”。团队随后使用相同任务分别复现,才能把统计相关转成工程判断。