自动运维:把重复矿机操作变成可控的后台规则
矿场规模扩大后,难的是让低算力、过热、离线等异常处理及时、一致且能回溯。ItsMiner 的自动运维位于“配置 > 自动运维”,可用预置操作和自定义计划,让后台持续执行常见判断与动作。
面向矿场管理员和运维主管。需先明确边界:自动运维用于矿机异常处理和任务派发;负荷调节、负荷保持与防唤醒属于电量模块。
先理解两类策略
自动运维遵循“监控状态 → 判断条件 → 执行动作 → 写入记录”,分为两类策略:
- 预置自动操作覆盖低算力自动重启、高温自动重启、高拒绝率自动重启、离线矿机自动下架、静态IP冲突自动下架、高温自动切换工作模式等常见场景。它适合先覆盖高频异常。
- 自定义自动运维计划适合矿场自己的处理逻辑。计划由名称、执行范围、触发条件、执行计划和执行时间组成,可将特定机型、子账户或网段与特定动作关联起来。
两类策略触发后的动作都会进入操作记录,让重复处理有一致依据和完整留痕。
从预置自动操作开始
预置项可按矿场单独开启,部分需要填写临界值。建议先覆盖低算力、高温或长时间离线等处理方式明确的异常,再根据记录调整阈值。
功能说明: 在“配置 > 自动运维”中开启对应预置项;需要阈值的项目,在编辑弹窗中填写临界值并保存。低算力、高拒绝率、高温重启及高温切换工作模式不会作用于 Sleep 模式矿机,且这些被过滤的矿机不会写入操作记录。
用途: 先让系统承担重复、低风险的处理,把人工留给需要判断的异常。
预置重启类操作有每日次数控制:每台矿机、每类预置操作默认最多触发 3 次,最高可设为 5 次,计数按矿场时区在每日 00:00 重置。这样能避免同一异常矿机反复重启而未进入人工排查。
用自定义计划匹配矿场策略
规则不止“超过阈值就重启”时,可新建自动运维计划。单个矿场最多保存 15 条,多个开启中的计划同时执行。配置顺序如下:
- 确定范围。 选择全矿场,或按机型、子账户、网段做包含或排除。
- 设置条件。 可使用 IP 冲突、工作模式、算力百分比持续时长、故障类型、矿场时间等条件;多个条件可按交集或并集组合。算力和故障类条件的持续时间最短为 5 分钟,并以 5 分钟为单位设置,适合过滤短暂波动。
- 选择动作。 条件满足后可重启、切换工作模式,或创建临时任务;需要现场检查时,优先创建临时任务。
- 设定执行时段。 默认全天执行,也可配置精确到分钟的开始和结束时间,并支持跨天。时段外即使计划仍开启,系统也不会评估新的触发条件。
例如,对某机型设置“风扇故障持续 5 分钟后创建临时任务”,可先识别并派发故障,避免用重启掩盖硬件问题。计划与临时任务或维修单绑定后,相关单据不可直接删除。
让自动化保持可控
计划执行取决于开关开启且当前时间在执行时段内。时段结束不会中断已开始的任务,只会阻止新的触发;切换矿场时区后,系统按新时区判断执行窗口。开关切换会清除实时统计,例如当日重启次数,不宜频繁切换。
功能说明: 管理员可创建、编辑、删除和开关预置项或计划;只有拥有配置模块管理权限的成员才能修改执行时段。高风险的批量重启或工作模式切换,仍受矿机操作限制约束。
用途: 将策略配置权与日常查看权分开,避免一项规则调整影响整个矿场。
一套可直接采用的运行节奏
- 上线前: 梳理高频异常,确认哪些可自动处理、哪些必须派单,并划定矿机范围。
- 第一周: 只启用少量预置操作;每天查看操作记录,确认触发频率、命中矿机和结果。
- 稳定后: 将重复且规则明确的场景沉淀为自定义计划;对瞬时波动增加持续时间。
- 每周复盘: 结合操作记录与值班记录,检查反复触发的矿机、失效阈值和不应自动执行的场景。
自动运维不是把所有异常交给系统,而是明确哪些该立即执行、哪些该派发、哪些必须人工判断。先用预置规则建立基础覆盖,再把验证过的经验写进自定义计划,日常运维才会从“盯告警”转向“管理规则”。
联系我们获取演示:
- 邮箱:sales@powsell.com
- Telegram:@ItsMinerOfficial
订阅 ItsMiner 博客
最新文章直达您的邮箱