昨天(8月26日)上午,我们的猎头报告生成服务出现全面故障,所有生成请求均返回失败。服务已临时下线,今天中午修复完成并重新上线。现将故障原因及处理过程做如下说明。
故障现象
8月26日,监控系统发现报告生成接口成功率骤降至0%。云函数日志显示,所有请求均因等待大模型响应超时而中断。
排查过程
首先检查代码版本——近期无发布变更,排除自身代码引入问题。
检查云函数运行环境、内存配置、超时设置——均无异常。
检查大模型API调用配额、网络连通性——均正常。
回滚至历史稳定版本进行对比测试——问题依然复现。
至此,所有可控变量均被排除。
根因定位
进一步比对成功与失败请求的差异日志后发现,混元大模型深度思考的默认值由“关闭”调整为“开启”。
该“深度思考”模式会显著增加模型推理时间,导致云函数在设定的超时阈值内无法完整接收返回数据,最终触发超时中断,造成所有报告生成失败。
解决方案
在API调用参数中显式传入 EnableDeepThink: false,恢复为原快速响应模式,服务已恢复正常。
调大云函数timeout时间。
影响范围
2026年8月26日至8月27日修复上线期间,所有报告生成请求均受影响。目前服务已全面恢复,历史失败请求可重新提交。
后续措施
以上就是本次故障的完整复盘。感谢各位用户在服务中断期间的耐心等待与理解。