一、说明 这份SOP是针对本地VMware+OpenStack双私有云集群整体资源耗尽、硬件无扩容余量,业务流量过载的标准化自愈处置流程,依托现有AI运维体系(小米MiMo大模型+OpenClaw+Hermes)实现资源研判、流量识别、智能分流、弹性扩容、分级限流与云上兜底,替代传统人工紧急扩容、临时限流操作。 整体核心目标:本地私有云资源打满时,…
一、说明 这份SOP是针对私有云OpenStack K8S集群(10.1.0.0/16)整体宕机、全网业务中断的应急处置流程,全程依托现有AI运维体系(小米MiMo大模型+OpenClaw+Hermes)实现自动化判断、告警、决策与故障切换。 整体核心目标:不依赖人工紧急排查,系统自动识别重大故障、推送飞书确认、智能判断是否切换公有云流量/扩容公有…
混合云Kubernetes集群全域组网、统一管控与容灾切换SRE技术规范 文档信息 项目 内容 文档名称 混合云K8S全域组网、统一管控与故障自动切换SRE规范 适用架构 私有云(VMware/OpenStack)+ 公有云(阿里云ACK/腾讯云TKE/华为云CCE)多套K8S混合集群环境 适用角色 SRE运维工程师、云平台架构师、容器运维人员、应…
着信息技术的快速发展,企业级监控系统成为了确保业务连续性和服务质量的关键组成部分。本文旨在对Zabbix与Prometheus两大主流监控系统进行深入的选型分析与比较。从性能容量、数据采集、数据可视化、告警管理等多个维度出发,探讨两者的技术特点、应用场景及优劣。通过对比研究,为企业在构建高效、稳定的监控体系时提供参考依据。同时,本文也将讨论在特定情境下同时部署两种监控系统的可能性及其优势。
使用 Rsyslog 实现 SSH 日志的 JSON 化,以便于后续的日志管理和分析。通过自定义 Rsyslog 的模板,可以将传统的文本日志转换为结构化的 JSON 格式,提高日志处理效率和可读性。
使用 Podman 部署 AList 容器应用,以实现对多种云存储服务的统一管理和高效利用。概述了多云时代面临的存储管理挑战,介绍 AList 的主要特性和功能。阐述使用 Podman 部署 AList 的步骤,包括下载镜像、运行容器和设置初始密码。总结 AList 的价值和应用场景,为读者提供了实用的操作指南。
使用 Python 编写一个脚本来实时监控 SSH 登录日志,并实现基于时间戳的异常检测机制。此外,还将展示如何配置 Supervisor 以确保脚本稳定运行。
CertD 是一款免费且高度自动化的工具,用于申请和部署 SSL 证书。它的命名灵感来源于 Linux 中的守护进程(daemon),其中 “D” 代表 “守护进程”(Daemon)。CertD 不仅能够自动化整个证书申请流程,还能自动更新和部署证书,确保网站的安全连接始终有效。
本文将深入探讨 Linux 中的 proc 文件系统,揭示其背后的工作机制,并通过一个具体的例子——修改网络端口范围——来展示如何通过 proc 文件系统与内核交互。此外,还将介绍 proc 文件系统的结构、用途以及如何利用它来调整系统配置。
在本文中,我们将探讨如何使用 `tc`(traffic control)工具在 Rocky Linux 9 系统上对网络接口进行流量控制。通过 `tc`,我们能够模拟各种网络条件,如带宽限制、延迟增加、丢包等,这对于测试网络应用在不同网络环境下的表现至关重要。本文将详细介绍 `tc` 的基本概念、常用命令以及如何配置简单的限速策略,旨在更好地理解并掌握这一强大的网络管理工具。