1.
概述:运维目标与合规要求
· 目标:保证站群可用性99.9%、平均响应时间<200ms。
· 合规:遵守香港与目标国家的网络与隐私法律,定期审计日志与数据保留策略。
· 角色:明确运维、网络、安全与业务负责人联动流程。
· SLA:制定对外SLA与内部SLO,出现故障按RTO/RPO处置。
· 文档:建立变更日志、配置管理数据库(CMDB)与运维手册并版本控制(Git)。
2.
基础环境与标准化配置示例
· 操作系统:推荐 Ubuntu 20.04 LTS 或 CentOS 8,安全更新自动化(unattended-upgrades)。
· 单机配置示例(真实案例参考):8 vCPU / 16GB RAM / 500GB NVMe / 1Gbps 公网带宽,Ubuntu 20.04。
· 栈建议:Nginx 1.18 + PHP-FPM (或 Node.js 14+);MySQL 8.0 主从复制;Redis 6 用作缓存。
· 高可用:keepalived + HAProxy(Virtual IP)或 LVS + Keepalived 实现故障切换。
· 存储与IO:事务库放在 NVMe,日志分离到独立磁盘或对象存储(S3/OSS),开启异地备份。
3.
日常监控指标与阈值
· CPU:单台平均负载(1min)< 4 × CPU 核心数为预警阈值,> 8 × 则触发紧急。
· 内存:可用内存比率低于20%触发清理或扩容预警。
· 磁盘:磁盘使用率>75%报警,磁盘 IOPS 或延迟(iostat 读/写延迟)>50ms 为异常。
· 网络:丢包率>0.5% 或 RTT 延时异常(>100ms)需告警,带宽利用率接近端口峰值(>85%)考虑扩容。
· 应用级:页面错误率(5xx)>1% 或 QPS/响应时间异常需迅速回滚或扩容。
4.
安全检查表(例表:运维每日/周/月检查)
· 表格说明:下表为示例性安全与状态检查,包含检查命令、频率与阈值。
| 检查项 |
检查命令/位置 |
频率 |
阈值 |
说明 |
| CPU/Load |
uptime / top |
每5分钟 |
1min load > 4×核数 |
扩容或调查进程 |
| 磁盘使用 |
df -h / iostat |
每日 |
使用率 >75% |
清理日志或扩盘 |
| 内存/Swap |
free -m / vmstat |
每小时 |
可用内存 <20% |
检查泄漏/重启服务 |
| 端口与防火墙 |
ss -tuln / iptables -L |
每周 |
开放端口符合白名单 |
关闭多余端口 |
| 入侵尝试 |
fail2ban / auth.log |
实时 |
异常登录>10次/小时 |
封禁IP并分析 |
· 结果归档:检查结果应写入监控平台(Prometheus+Grafana)与工单系统。
5.
DDoS 与网络防护策略
· CDN:使用 Cloudflare / 阿里云 CDN 做静态加速与边缘清洗,减轻源站压力。
· BGP/Anycast:部署 Anycast IP 或与当地带宽商合作实现流量吸纳与均衡。
· 高防产品:对重要出口IP绑定高防IP(示例:20Gbps/100Gbps 清洗带宽视供应商),并配置速率限制。
· 连接策略:对管理接口限定白名单访问,SSH 使用非标准端口与密钥认证。
· 案例:某
香港站群采用10台1Gbps VPS + Cloudflare Pro,峰值攻击时经边缘清洗后源站峰值流量降至正常的5%且无服务中断。
6.
备份与恢复演练细则
· 策略:数据库每日全量或每小时增量,文件每日快照,异地保留7/30/90天(短/中/长期)。
· 工具:使用 Percona XtraBackup(MySQL)或 mysqldump + rsync,文件用 rclone 同步到对象存储。
· 恢复目标:RTO < 30 分钟(关键服务),RPO 视业务为1小时或更短。
· 演练:每季度进行一次完整恢复演练并记录时间与问题清单。
· 示例:真实运维中,某站群在演练中发现 WAL 日志未及时归档,导致恢复延迟,随后修正备份脚本并追加告警。
7.
应急响应与日志分析流程
· 报警接收:告警分级(P0/P1/P2),P0 需15分钟内响应并启动应急通道(电话+群聊)。
· 初步处置:先做流量隔离/黑洞、临时限流或切换至备用节点,保护核心服务。
· 取证保全:保留原始日志、tcpdump 包(分片)与系统快照,用于后续 RCA 与法务需求。
· 恢复与回溯:完成临时缓解后逐步回滚到正常路由并验证数据完整性。
· 总结与优化:事件结束后24-72小时内提交事故报告,更新运维手册与自动化修复流程。
来源:香港站群服务器维护新手必读的运维规范与安全检查表