基于Bash脚本的自动化值班告警推送系统实战
基于Bash脚本的自动化值班告警推送系统实战背景运维工作中,值班人员需要在告警发生时第一时间收到通知。传统的做法是依赖监控平台推送,但监控平台可能存在延迟或推送失败的情况。本文介绍如何基于 Bash 脚本构建一个轻量级的自动化值班告警推送系统,在监控平台告警的基础上增加一层保障,确保告警不遗漏。 系统架构整个系统由三个核心模块组成: 告警采集模块:从监控平台(如 Prometheus Alertmanager)拉取告警 告警过滤模块:根据规则过滤重复告警、静默告警 告警推送模块:通过邮件、钉钉/飞书 Webhook 等渠道推送 核心脚本实现1. 告警采集脚本12345678910111213141516#!/bin/bash# alert_fetch.sh - 从 Alertmanager 获取告警ALERTMANAGER_URL="http://localhost:9093/api/v1/alerts"OUTPUT_FILE="/var/log/ops/alerts_fetched.json"LOCK_FILE="...
每日科技要闻-2026-05-19
每日科技要闻(2026年5月19日) 数据来源:Tavily Search | 检索日期:2026-05-19 🤖 人工智能1. 香港中文大学成立香港首个全端具身智能实验室摘要:香港中文大学HKCLR宣布成立「香港具身智能实验室」,乃香港首个全端具身智能实验室。与24家业界伙伴合作,聚焦机器人硬件、控制算法及场景落地产业化。实验室研究成果已发表于国际知名期刊《Science Robotics》。来源:https://www.cpr.cuhk.edu.hk/tc/press/cuhk-establishes-hong-kongs-first-full-stack-embodied-ai-lab-to-advance-ai-driven-industrial-transformation/ 2. 字节跳动收缩AI项目、腾讯换船:中国AI应用进入成本与场景重整期摘要:TechNews报道,字节跳动砍三成AI项目、腾讯换船,中国AI应用正进入成本与场景重整期。各大厂商加速真实场景落地,”百模大战”落幕后,产业生态构建与应用价值深挖成为新赛点。来源:https://technews....
NVIDIA GPU驱动安装与日常运维指南
概述随着AI和高性能计算的快速发展,GPU服务器已成为数据中心的重要基础设施。GPU驱动的稳定运行直接决定了计算任务的成功率。本文详细介绍NVIDIA GPU驱动的手动安装、常用运维命令、常见故障排查以及日常监控方法,帮助运维人员高效管理GPU服务器。 一、环境准备1.1 确认硬件兼容性安装驱动前,首先确认GPU型号和服务器架构: 123456# 查看PCIe插槽上的GPU设备lspci | grep -i nvidia# 典型输出示例# 1a:00.0 VGA compatible controller: NVIDIA Corporation GA100 [A100 80GB] (rev a1)# 1d:00.0 VGA compatible controller: NVIDIA Corporation GA100 [A100 80GB] (rev a1) 支持的驱动版本需与GPU架构匹配:Tesla/Volta/Ampere架构建议使用470+驱动,Ada Lovelace/Hopper架构建议使用525+驱动。 1.2 检查当前环境12345...
每日科技要闻-2026-05-18
每日科技要闻 | 2026年5月17日 数据来源:Tavily 搜索 | 制表时间:2026-05-18 一、AI 与大模型1. Anthropic 估值破万亿,成为全球 AI 新王Anthropic ARR 突破 440 亿美元,15 个月增长 80 倍,企业市占率 34.4% 首超 OpenAI 的 32.3%,最新 Pre-IPO 估值达 1.2 万亿美元,本轮计划融资 500 亿美元逼近万亿大关。来源:https://juejin.cn/post/7640332861916774440 2. Cerebras 创史上最大 AI 芯片 IPOAI 芯片厂商 Cerebras 在纳斯达克正式挂牌,IPO 共发行 3000 万股,超额配售权行使后募资总额高达 55.5 亿美元,超越 Arm 创美股史上半导体公司 IPO 募资纪录。上市首日股价暴涨 68%。来源:https://juejin.cn/post/7640332861916774440 3. 阶跃星辰 170 亿冲刺港股 IPO继 Kimi、DeepSeek 之后,阶跃星辰完成 170 亿元融资冲刺港股 IPO,中...
GitOps实践指南:基于ArgoCD的声明式持续部署
GitOps实践指南:基于ArgoCD的声明式持续部署概述GitOps 是一种以 Git 为唯一信源的运维理念,通过声明式配置实现基础设施和应用的自动化部署。其核心思想是:将所有配置写入 Git 仓库,每次提交自动同步到集群,确保环境一致性。 ArgoCD 是目前最流行的 GitOps 工具之一,专注于 Kubernetes 环境的持续交付。本文介绍 ArgoCD 的部署、配置及最佳实践。 环境准备前置条件 Kubernetes 1.19+ kubectl 已配置集群访问 Git 仓库(GitHub/GitLab/私有均可) 安装 ArgoCD12345678# 创建命名空间kubectl create namespace argocd# 部署 ArgoCDkubectl apply -n argocd -f https://raw.githubusercontent.com/argoproj/argo-cd/stable/manifests/install.yaml# 查看服务(等待 pod 就绪)kubectl get pods -n argocd 生...
每日科技要闻-2026-05-17
每日科技要闻 | 2026年5月17日 数据来源:Tavily搜索 | 搜索日期:2026-05-16 一、国内科技要闻1. 阿里发布Qoder 1.0:AI编程迈入”自动驾驶”时代阿里云正式推出Qoder 1.0智能代码工作台,从传统AI IDE升级为智能体自主开发工作台。用户只需输入自然语言需求,AI Agent团队就能自主完成需求拆解、代码编写、测试验证、项目交付全流程,全程无需人工干预,适配Windows/macOS/Linux三大系统。来源:魔珐星云开发社区链接:https://xingyun3d.csdn.net/6a082c8610ee7a33f272f643.html 2. 中国信通院联合三大运营商发起智能IP广域网(AI WAN)应用推进行动在武汉举办的世界电信和信息社会日大会上,中国信通院联合三大运营商、AIIA等机构正式发起智能IP广域网应用推进行动,聚焦企业入算、边缘入算、城域网络、数据流通四大核心方向,标志着国内AI算力基建从”单点建设”转向全网协同。来源:新华网链接:http://www.news.cn/tech/2026051...
Linux内核活锁故障诊断与处理指南
什么是内核活锁内核活锁(Livelock)是Linux内核的一种异常状态,与死锁不同,活锁发生时内核或某个CPU核心并非完全无响应,而是持续忙于处理某个任务,导致用户态进程无法获得合理的CPU时间片。具体表现为系统负载高企,但CPU利用率分布异常——内核态占用率极高而用户态几乎为零,整体吞吐量为零。 与IO占用导致的假性高负载不同,活锁的内核CPU占用没有对应的IO操作作为代价;与硬中断风暴不同,活锁的问题源出在内核代码本身的同步逻辑而非外部中断触发。识别活锁的关键特征是:进程处于D状态(不可中断睡眠)持续数十秒甚至更久,同时CPU的sys占用率异常偏高。 典型触发场景内核活锁多见于以下场景: 内核锁竞争激化:多核服务器上多个CPU核心同时争用同一把自旋锁,导致大部分时间消耗在锁等待上而非实际计算 RCU读写锁争用:大量CPU核心同时持有RCU读锁,迫使写锁持有者长时间无法完成临界区 调度器异常:在调度器关键路径上发生长时间不可中断等待,如cfs调度器的延迟等待 内存回收路径卡顿:kswapd或直接内存回收路径中发生长等待,导致进程在内存分配时进入D状态 文件系统元数据锁:NF...
每日科技要闻-2026-05-16
每日科技要闻日期:2026年5月15日 一、国内科技要闻1. 中芯国际联合CEO赵海军:对今年整体运营情况更加乐观中芯国际联合CEO赵海军在季度业绩说明会上表示,基于客户需求和在手订单情况,公司对今年整体运营情况更加乐观。人工智能对配套芯片的强劲需求,直接推动公司电源管理芯片产能供不应求;同时产业链国产化诉求,推动国产逻辑、网通等芯片需求持续增长。来源:新浪财经 | https://k.sina.com.cn/article_7857201856_1d45362c001905hj76.html 2. 微软AI亚太区首席应用科学家归国,加盟同济大学曾任微软人工智能亚太区首席应用科学家的李宏智近期放弃微软高薪工作回国,现为同济大学工程智能研究院长聘特聘教授。李宏智入选国家海外高层次人才引进计划,过去十年在微软担任搜索与人工智能事业部首席研究员/架构师。来源:观察者网 | https://k.sina.com.cn/article_7857201856_1d45362c001905hj76.html 3. 2026全球人工智能终端展在深开幕,数千款前沿终端亮相以”端启未来·...
基于滑动窗口的Prometheus告警规则优化实践
基于滑动窗口的Prometheus告警规则优化实践背景在使用 Prometheus 进行监控告警时,最常见的问题之一是告警风暴——当某个基础组件故障时,依赖它的数十个服务可能同时触发告警,导致运维人员被淹没在大量重复告警中,无法快速定位根因。与此同时,瞬时抖动也会造成误报:某个指标短暂超出阈值又迅速恢复,触发了一条毫无意义的告警。 本文介绍一种基于滑动窗口的告警规则优化方案,结合 Prometheus 的 for 子句、区间查询和告警抑制机制,显著提升告警质量。 一、滑动窗口告警的核心思路传统的告警规则通常这样写: 12345678groups: - name: node_rules rules: - alert: HighCPU expr: avg(rate(node_cpu_seconds_total[5m])) * 100 > 80 for: 5m labels: severity: warning 这段规则的问题是:如果 CPU 在 5 分钟内反复抖动——先超过 80% 持续 3 分钟,...
每日科技要闻-2026-05-15
每日科技要闻日期:2026年5月15日(昨日要闻) 1. 斯坦福AI指数报告:中美AI技术差距基本抹平来源:钛媒体链接:https://www.tmtpost.com/7952122.html 斯坦福大学以人为本人工智能研究所发布《2026年人工智能指数》报告。报告显示,美国AI模型仅比DeepSeek等中国模型领先2.7%,技术差距已基本抹平。美国AI投资规模达2859亿美元,是中国的23倍,但中国在论文发表量、专利数量和工业机器人装机量方面领先全球。 2. 思科宣布裁员4000人转向AI,股价暴涨15%创13年纪录来源:新浪AI热点链接:https://k.sina.com.cn/article_7857201856_1d45362c001905h3wi.html 5月14日晚,科技巨头思科股价暴涨超15%,市值突破3万亿元人民币。思科宣布计划裁员数千人,将资源集中到快速增长的AI市场。第四财季营收预计167-169亿美元,远超分析师预期的158亿美元。CEO查克·罗宾斯表示,裁员是为了让公司重新聚焦AI时代。 3. AI人才争夺战:2000投资人蹲路演,年薪700万抢...