Skip to Content
运维 SOP服务器管理

服务器运维管理规范

一、目的与适用范围

1.1 目的

本规范旨在建立标准化、可执行的服务器运维管理流程,降低操作风险、减少人为失误,保障系统安全、稳定运行。

1.2 适用范围

  • 所有生产环境服务器
  • 预发布与环境
  • 数据库服务器
  • 文件存储服务器

二、账户与登录管理

2.1 账户分类

账户类型用途权限级别
root系统管理员最高
ops运维工程师高级
deploy应用部署中级
app应用程序运行用户普通

2.2 账户申请流程

  1. 申请发起:需求方填写《服务器账户申请表》
  2. 审批:《服务器账户申请表》需经 CTO 或运维负责人审批
  3. 创建:由运维工程师创建账户并配置权限
  4. 记录:在《服务器账户清单》中登记新账户信息

2.3 账户使用规范

  • 账户密码长度不低于 16 位,含大小写字母、数字与特殊字符
  • 密码每 90 天更换一次
  • 禁止多人共用同一账户
  • 岗位变动时,账户权限应立即调整或注销

2.4 账户清理

  • 员工离职当日完成账户注销
  • 项目结束后 3 个工作日内清理相关账户
  • 临时账户使用完毕后立即删除

三、SSH 登录安全

3.1 登录原则

  • 禁止密码登录:所有服务器必须使用 SSH Key 认证,禁止密码登录
  • 最小权限:仅开放必要用户的 SSH 访问权限
  • 变更记录:所有 SSH 登录行为需记录日志

3.2 SSH Key 管理规范

  • SSH 公钥需登记在《SSH Key 清单》中
  • 私钥必须设置 passphrase,禁止使用空密码
  • 私钥文件权限必须为 600
  • 私钥文件仅存储于公司配发设备

3.3 SSH 配置要求

# /etc/ssh/sshd_config 建议配置 PermitRootLogin no PasswordAuthentication no PubkeyAuthentication yes MaxAuthTries 3 ClientAliveInterval 300

3.4 登录审计

  • 运维工程师需通过跳板机登录服务器
  • 所有操作需在 screen/tmux 会话中执行
  • 敏感操作需双人知悉

四、远程控制(RustDesk)安全

4.1 使用场景

RustDesk 用于服务器应急远程控制,需严格管理以防止未授权访问。

4.2 配置要求

  • ID 与密码:按服务器分配独立的 ID 和密码,禁止复用
  • 密码复杂度:不少于 12 位,含数字、大小写字母
  • 访问控制:仅允许经授权的 IP 地址连接
  • 自动锁屏:客户端设置 5 分钟无操作自动锁屏

4.3 使用规范

  • 远程控制权限需经运维负责人审批后开通
  • 使用完毕后立即锁定或断开连接
  • 应急使用后需在《远程控制使用记录》中登记

五、软件与系统变更

5.1 变更分类

变更类型说明审批要求
一般变更软件版本更新、配置调整运维负责人审批
重要变更系统升级、安全补丁CTO 审批
重大变更核心系统迁移、架构调整技术委员会审批

5.2 变更申请流程

  1. 填写申请:在《服务器变更申请表》中详细说明变更内容、影响范围、回滚方案
  2. 技术评估:运维工程师进行技术可行性评估
  3. 审批:按变更类型提交相应层级审批
  4. 执行:在维护窗口期内执行变更
  5. 验证:变更后验证系统功能与性能
  6. 记录:在《变更记录表》中记录执行结果

5.3 维护窗口

  • 常规维护窗口:每周六 02:00 - 06:00
  • 紧急维护需提前 2 小时通知

六、公网端口与对外服务安全

6.1 端口开放原则

  • 最小化原则:仅开放业务必需的端口
  • 审批流程:在《端口开放申请》中说明用途与安全措施
  • 定期审计:每季度审计一次公网端口开放情况

6.2 端口管理规范

服务类型端口要求说明
Web 服务仅开放 80/443通过 WAF/负载均衡
SSH仅内网访问禁止公网直接访问
数据库仅内网访问禁止公网直接访问
其他按需申请需安全评估

6.3 对外服务安全要求

  • 所有对外服务必须配置 IP 白名单
  • 敏感服务需启用双因素认证
  • 定期扫描公网暴露面

七、数据库安全

7.1 账户管理

  • 应用程序使用独立数据库账户,权限遵循最小化原则
  • 禁止应用程序使用 root 或高权限账户
  • 数据库管理员账户仅运维人员知晓

7.2 访问控制

  • 数据库仅允许来自内网指定 IP 的连接
  • 生产数据库禁止直接执行 DELETE 或 UPDATE 无 WHERE 条件语句
  • 敏感查询需在监控下执行

7.3 备份与恢复

  • 每日凌晨执行全量备份
  • 每小时执行增量备份
  • 备份文件加密存储,保留不少于 30 天
  • 每季度执行一次恢复演练

八、数据与文件管理

8.1 存储规范

  • 日志文件按日期归档,保留 90 天
  • 业务数据存储于独立分区,与系统分区分离
  • 临时文件使用后及时清理

8.2 文件传输

  • 使用 SFTP/SCP 进行文件传输
  • 禁止使用匿名 FTP
  • 传输前后校验文件完整性

8.3 敏感文件处理

  • 敏感文件需加密存储与传输
  • 配置文件中的密码需使用环境变量或密钥管理服务
  • 包含敏感信息的日志需脱敏处理后再存储

九、物理与网络安全

9.1 服务器托管

  • 服务器托管于正规数据中心
  • 机柜上锁,他人访问需登记

9.2 网络隔离

  • 生产网络、办公网络、测试网络隔离
  • 不同业务间网络隔离
  • 堡垒机作为唯一入口

9.3 安全监控

  • 部署主机入侵检测系统(HIDS)
  • 网络流量异常监控
  • 定期进行漏洞扫描与修复

十、故障与异常处理

10.1 故障分级

级别定义响应时间恢复时间
P0核心业务中断5 分钟30 分钟
P1重要业务受损15 分钟2 小时
P2一般故障30 分钟4 小时
P3轻微异常2 小时24 小时

10.2 故障处理流程

  1. 发现:通过监控告警或人工发现
  2. 响应:确认故障,评估影响范围与级别
  3. 止损:采取必要措施阻止损失扩大
  4. 定位:分析日志、监控数据定位根本原因
  5. 修复:执行修复方案
  6. 验证:确认服务恢复正常
  7. 复盘:编写《故障报告》,分析原因并制定改进措施

10.3 告警处理

  • 告警发生后 5 分钟内确认
  • P0/P1 级别告警立即电话通知运维负责人
  • 所有告警需在《告警记录表》中登记处理结果

十一、附则

11.1 规范解释

本规范由运维团队负责解释。本规范自发布之日起执行。

11.2 定期评审

本规范每半年评审一次,根据业务发展与安全形势进行修订。

11.3 违规处理

违反本规范的行为将根据情节严重程度,按照公司相关规定处理。


相关文档

  • 运维工程师首页
  • [账户申请表(内部流程)]
  • [服务器账户清单(内部文档)]
  • [SSH Key 清单(内部文档)]
  • [变更记录表(内部文档)]
最后更新