RAID 磁盘阵列配置与故障恢复
RAID 磁盘阵列配置与故障恢复
一、RAID 级别选择指南
1.1 常见 RAID 级别对比
| RAID 级别 | 最少磁盘数 | 可用容量 | 容错能力 | 读性能 | 写性能 | 适用场景 |
|---|---|---|---|---|---|---|
| RAID 0 | 2 | 100% | 无 | 最优 | 最优 | 临时数据、缓存 |
| RAID 1 | 2 | 50% | 1 块磁盘 | 优 | 中 | 系统盘、关键数据 |
| RAID 5 | 3 | (N-1)/N | 1 块磁盘 | 优 | 中 | 通用文件服务器 |
| RAID 6 | 4 | (N-2)/N | 2 块磁盘 | 优 | 较差 | 大容量存储、归档 |
| RAID 10 | 4 | 50% | 每组 1 块 | 最优 | 优 | 数据库、高 IOPS 场景 |
1.2 选型建议
- 数据库服务器:优先 RAID 10,兼顾性能与冗余
- 文件服务器:RAID 5 或 RAID 6,平衡容量与成本
- 系统启动盘:RAID 1,简单可靠
- 备份存储:RAID 6,允许同时损坏 2 块磁盘
二、软件 RAID 配置(mdadm)
2.1 安装 mdadm
1 | # CentOS/RHEL |
2.2 创建 RAID 1 阵列
1 | # 查看可用磁盘 |
2.3 创建 RAID 5 阵列
1 | # 创建 RAID 5(至少 3 块磁盘) |
2.4 创建文件系统并挂载
1 | # 创建 ext4 文件系统 |
2.5 保存 RAID 配置
1 | # 备份当前配置 |
三、硬件 RAID 配置
3.1 进入 RAID 配置界面
- 开机自检时:根据 RAID 卡提示按键(常见:Ctrl+R、Ctrl+H、F10)
- IPMI/BMC:通过 Web 界面远程配置
- 操作系统工具:
MegaCli、storcli(LSI/Broadcom)
3.2 使用 storcli 管理 LSI RAID
1 | # 安装 storcli |
四、RAID 故障处理
4.1 磁盘故障识别
1 | # 查看 RAID 状态 |
4.2 标记磁盘失效并移除
1 | # 标记磁盘为失效 |
4.3 更换磁盘并重建
1 | # 物理更换磁盘后,将新磁盘加入阵列 |
4.4 常见故障代码
| 状态标识 | 含义 | 处理措施 |
|---|---|---|
| [UU] | 健康 | 无需操作 |
| [U_] | 一块磁盘失效 | 尽快更换 |
| [_U] | 一块磁盘失效 | 尽快更换 |
| [__] | 阵列崩溃 | 尝试数据恢复 |
| degraded | 降级运行 | 避免重启,立即更换 |
五、日常维护与监控
5.1 配置邮件告警
1 | # 编辑 mdadm 配置 |
5.2 定期检查脚本
1 |
|
5.3 添加 cron 定时检查
1 | # 每天上午 9 点检查 |
六、最佳实践总结
- 定期巡检:每周检查 RAID 状态,关注 SMART 信息
- 备件储备:保持 1-2 块同型号磁盘作为备件
- 监控告警:配置邮件/短信告警,故障第一时间通知
- 数据备份:RAID 不是备份,重要数据仍需异地备份
- 重建优先:故障磁盘尽快更换,避免第二块磁盘故障导致数据丢失
- 文档记录:记录 RAID 配置、磁盘序列号、更换历史
七、参考资料
- mdadm 官方文档:https://man7.org/linux/man-pages/man8/mdadm.8.html
- LSI storcli 用户指南
- 《Linux 磁盘管理权威指南》
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 体系所运维知识库!