开班信息
AI智能运维 时代刚需

AI产业规模化落地的生命线

  • AI Ops与网络安全·AI时代的必备底座

    AI时代,资产价值高、攻击面全域扩大、业务容错为零
    AI Ops与网络安全协同构建“稳定高效+安全可信”双底座

  • AI智能运维·生产力的放大器与效率引擎

    让算力硬件从“有没有”变成“好不好用”,释放新质生产力
    自我调度/自愈/预测优化,释放闲置算力拉高资源利用率

人工智能

AI浪潮

大模型训练、AIGC创作、AI视频生成、数字人、智能推理

智能调度千亿参数训练,动态分配GPU集群,保障推理服务高可用,成本降低

先进制造

工业4.0

数字孪生、工业智能质检、产品仿真研发、柔性智能生产

保障数字孪生实时同步,预测性维护产线,故障响应时间<1s

交通领域

智能出行

自动驾驶、车路协同、智慧交通调度

毫秒级监控边缘节点,弹性调度算力资源,保障车路云一体化99.999%可靠性

城市治理

智慧城市

城市大脑、智慧安防、全域交通调度、应急智能处置

实时融合城市数据,自动扩缩容,保障突发应急场景下毫秒级响应

文娱领域

元宇宙

元宇宙场景搭建、实时云端渲染、虚拟直播、沉浸数字文娱

智能调度渲染节点,保障高并发低延迟,用户体验无感知故障恢复

科研领域

探索

新药研发、气候模拟、可控核聚变推演、高端材料研发

智能管理超算集群,任务优先级调度,资源利用率提升加速科研突破

AI智能运维的重要性?
企业 高薪抢人

懂AI、能主导智能运维的人才

  • 国家战略·刚性需求

    “人工智能+”行动意见(国务院,2025)

    强化智算统筹、自动化监测与智能调度

    算力基础设施高质量发展行动计划(工信部)

    推动数据中心自动化、智能化、绿色化运维

    东数西算·八大枢纽(国家算力枢纽)

    海量GPU/NPU异构集群无法人工运维

  • 产业市场·企业落地

    Gartner 预测60%+中大型企业落地AI Ops平台

    国内AI Ops市场年复合增速>34%

    重点需求行业

    互联网大厂·金融机构·新能源车企、智算中心运营商·大模型AI初创、运营商云·政务算力平台

  • 需求爆发·薪资跃升

    25.8k 全国平均月薪

    薪资普遍比传统运维高出40%~90%

    同等年限下,AI智能运维的薪资天花板更高

    +217% 2026招聘岗位增速

    对比2024年同期岗位增长580%

数据来源:猎聘大数据研究院《2026 年 Q1 I 岗位供需报告》及Gartner 相关预测、黑马程序员AI智能运维学员就业统计

放心学,优就业
黑马程序员AI智能运维学科全国就业情况

毕业班级 就业率 一线城市均薪 应届生占比
武汉AI运维1期 98% 11067 48%
郑州AI运维2期 92% 11220 55%
郑州AI运维3期 93% 11306 73%
广州AI运维1期 97% 10636 52%
郑州AI运维4期 96% 10572 72%
郑州AI运维5期 93% 12716 50%
郑州AI运维6期 96% 10368 70%
广州AI运维2期 91% 12988 55%
更多就业情况?
AI智能运维 入门简单

零基础拥抱AI时代高薪机遇

  • 零基础友好
    告别AI高门槛内卷

    入学门槛宽松,大专/本科均可,计算机应届生、转行小白、传统运维升级,零基础都能快速上手

  • 旧技能无缝复用
    传统运维最优升级路

    Linux、云计算经验100%复用,叠加云原生、GPU算力调度、AI Ops分析,低成本突破薪资天花板

  • 职业生命周期超长
    积累经验持续落地

    “AI Ops智能运维+云原生+GPU算力”政企、互联网/科技企业的新一代技术标配 技术迭代稳定

3分钟了解AI运维

什么是AI智能运维(AI Ops)?

依托大数据、时序算法、大模型、AIAgent技术,对服务器、云平台、业务链路、算力集群实现异常预判、告警降噪、故障根因分析、故障自愈。

  • AI运维学什么?
  • 低学历能拿到高薪吗?
  • 学完AI运维以后做什么?
  • 黑马课程有哪些优势?
我适合学吗?
核心能力清单 锚定未来

四大主流就业方向

  • 云原生与DevOps运维(SRE)
     入门首选

    核心学习内容:

    Rocky Linux网络/高级/核心服务
    AI辅助Shell/Python脚本
    Docker/K8s全栈编排+Helm
    Nginx+Keepalived高可用
    MySQL主从/Redis高可用集群
    Ansible自动化+发版管理
    CI/CD+ArgoCD GitOps
    Prometheus/ELK/SkyWalking可观测
    阿里云组件与云迁移实战
    Nacos/RabbitMQ中间件运维

    零起点,大专可入行
    无强制数学/算法基础要求

  • 智算与大模型运维(AI Infra)
    热门·高薪紧缺

    核心学习内容:

    GPU显卡驱动/CUDA环境配置
    GPU资源管理与算力调度
    nvidia-container-toolkit运行时
    K8s GPU调度策略
    K8s集群部署DeepSeek
    vLLM推理框架实战
    Ollama模型部署与联调
    Dcgm-exporter GPU监控
    ACK/VPC云上智算实战

    大专可入门,核心岗位要求本科
    掌握“GPU调度+大模型部署+GPU监控”即可就业

  • AI 智能运维与Agent开发
    复合型·高薪

    核心学习内容:

    Python脚本开发+企微钉钉告警
    Codex AI辅助编程
    MCP自定义开发与工具调用
    Hermes Agent框架实战
    Prompt工程/Memory/RAG
    多Agent协同与工作流编排
    Dify知识库与工作流构建
    监控集成+AI根因定位RCA
    自动巡检自动修复闭环运维
    SmartCloud多智能体云客服

    本科为主,中小企业可接受大专
    需具备Python脚本+Agent编排能力

  • 信创运维与具身智能交付
    国家战略·稳定就业

    核心学习内容:

    信创政策与2+8+N体系
    麒麟OS安装配置与运维
    openEuler网络与防火墙
    openGauss部署备份恢复
    达梦DM9 SQL与备份恢复
    大模型信创适配部署
    机器人真机开箱与调试
    LinkSoul智能体编排
    机器人刷机与日志导出
    系统加固/大模型安全护栏

    大专可入行,稳定性强
    政策红利导向,面向政企与信创生态

AI智能运维(AI Ops)四大能力体系

01 基建部署与可观测 — 让系统“看得见问题”
给数字系统装“眼睛和神经”

实时监控所有设备、软件,采集运行数据,让AI熟知系统状态

02 智算集群与算力调度 — 让系统“有力气处理信息”
给AI配上“超强心脏和体能”

高性能服务器组成“超级计算团队”,扛住海量数据与AI分析

03 智能体应用部署 — 让系统“看得懂、会思考”
给AI装上“智慧大脑”

AI学习海量故障案例,自主判断隐患、精准定位问题

04 自动化运维管控 — 让系统“自己会处理、会优化”
系统“自我修复、全程省心”

自动巡检、自动修复小故障、过滤无效告警,告别熬夜救火

申请免费试听
五大独家优势 实力碾压

剑指高薪AI智能运维岗

优势一

覆盖运维8大热门就业方向

  • 应用/系统运维工程师

    日常Linux服务器巡检、应用发版、基础故障排查与监控告警处理

  • 软件实施/交付工程师

    部署软件到客户服务器/私有云,并进行调试和客户培训

  • 初中级数据库运维
    DBA工程师

    专注企业的数据底层,不用直面业务代码的Bug,工作相对纯粹

  • 云原生与DevOps工程师

    实现代码提交到自动上云全链路自动化。大厂&中型互联网“标配刚需”

  • AI Infra/大模型
    运维工程师

    负责GPU算力集群调度、VLLM推理框架部署及大模型私有化落地

  • 信创运维工程师

    麒麟/欧拉OS+达梦/高斯数据库,党政军、金融、国企国产化替代

  • AI Ops/自动化
    运维工程师

    用AI管理IT!构建自动化监控与故障自愈体系,策略制定与平台开发

  • 机器人交付/实施工程师

    商用/人形机器人硬件调试、AI智能体配置与现场交付

项目名称:AI智能体项目之星海智伴、K8s生产级项目实战、云岚到家微服务项目部署与维护、云迁移升级实战、AI Ops 智能化监控项目、机器人交付工程、AI Infra 模型建设项目、AI SmartCloud多智能体项目部署与维护

优势二

独家打造AI Infra+AI Agent+
AI Ops全新运维体系

  • AI Infra 算力底座【搭舞台】

    手把手教学GPU服务器驱动安装、算力分配、算力平台搭建,吃透AI行业核心算力底层技术

    GPU驱动·安装与调优、算力分配·资源池化调度、平台搭建·生产级算力底座

  • AI Agent 模型部署【请演员】

    熟练完成各类大模型、智能体软件的上线部署、调试适配,让AI业务稳定落地运行

    大模型部署·LLM/VLM上线、智能体适配·调试与调优、稳定运行·业务级SLA保障

  • AI Ops 智能自治【雇管家】

    解锁AI自动化运维核心技能,搭载智能运维体实现故障自动报警、智能分析、自主修复,全程无需人工反复盯岗排查,仅需简单复核确认

    自动报警·智能异常检测
    智能分析·根因定位
    自主修复·故障自愈闭环

工作轻松·效率翻倍  职场竞争力断层领先

真正实现从熬夜加班的运维苦力升级为指挥AI干活的技术架构人才

优势三

从试学到就业,全程深耕
国产化信创核心技术体系

国产化核心技能栈·政企刚需【市场占有率领先】
  • 麒麟 OS
  • 欧拉 OS
  • 达梦 DB
  • 高斯 DB
  • 国产化中间件
  • 信创云平台
  • 国产网络设备
  • ... ...

√ 全覆盖政企招聘核心考点·黄金刚需技能

  1. 课程贴合国家“2+8+N”信创战略核心人才需求,重点教学政企大批量应用的麒麟、欧拉操作系统与达梦、高斯标杆国产数据库
  2. 1:1还原政企真实信创业务场景实战,完整练习系统运维、数据库迁移及性能调优,吃透国企政务统一技术规范
  3. 系统化一站式学习省去自学成本,掌握企业紧缺国产化技能,适配多种高薪岗位,抢占信创人才缺口

朝九晚五·工作轻松·薪资稳定

日常监控、对接乙方,空余时间充足·兼顾工作与考编

会信创=稳定就业特权
国企/央企/事业单位/政府机构,黄金刚需技能

优势四

全国校区统一部署
云原生企业级物理服务器集群

虚拟机·纸上谈兵

传统网课、普通培训班全程依托笔记本虚拟机实操,和企业真实生产环境脱节

上岗不敢碰真机·上手就翻车

  • × 资源虚拟化,性能严重缩水
  • × 网络环境与生产隔离
  • × 集群规模最多2-3台
  • × 无法模拟真实故障场景
真机实训·硬核实战

1:1复刻企业工作场景,学员全程远程直连真实机房设备实操,练的每一项技能都贴合上岗需求

真刀真枪·面试直接对标企业项目

  • √ 真实物理服务器·性能无损耗
  • √ 生产级网络与存储架构
  • √ 每组3台高配真机集群
  • √ 真实故障排查&应急演练
  • 3 台/组·高配真机
  • 200G 内存
  • 80核 CPU
  • 云原生 企业级集群
  • 远程直连 真实机房
优势五

一次学习,解锁“AI智能运维
+网络安全”两套高薪核心本领

【新增】人形机器人全流程交付 直击顶流科技红利
  • √ 众擎、智元头部机器人实操
  • √ 设备开箱·整机调试·功能定制
  • √ 商用场景落地交付全链路
  • √ 手握前沿案例,面试碾压普通运维
高端科技岗机器人运维优先
【赠送】网络安全+大模型安全 全套课
全网首发·价值¥15000
  • √ 网络安全全套实战技术
  • √ 大模型安全全新定制课程
  • √ 为期60天·8月全新首发
  • √ 稀缺高端网安技能附赠
运维+网安 双向就业通道

双赛道硬核兜底,职业进退自由
求稳可深耕AI智能运维岗位
进取可冲刺网安/机器人高端岗位

获取课程大纲

一门课程

构建企业AI智能运维全栈能力

课程覆盖企业AI智能运维工作完整生命周期
完整复刻企业AI Ops真实业务闭环 告别碎片化知识点学习

01 国产信创与AI大模型入门

课程介绍

紧跟国家信创战略与 AI 浪潮,融合“国产操作系统+云监控+大模型私有化部署”,零基础快速构建信创运维与 AI 应用的双重技术底座。

能力目标

掌握国产信创操作系统与云监控的核心运维技能,具备独立部署与调试 DeepSeek 等国产 AI 大模型的实战能力。

主要内容

运维的工作内容,云计算概念,服务器概念,常见运维名称,网络三要素,kylin服务器安装和配置

目录结构,文件和文件夹操作命令和概念,文件解压缩命令

软件包分类,软件包安装卸载操作,系统服务操作,防火墙开关以及进程的操作

云服务器定义、厂商(阿里云等)、特点(虚拟化、按需分配等)、优势;阿里云 ECS 实例选择(经济性 / 通用算力型等)、计费(按量付费 / 包年包月等)、购买流程;ECS 使用(重启、资源调整、安全组创建、远程连接);云监控介绍、开通、主机监控、资源报警配置、可视化大屏设置

大模型介绍、项目架构、云服务器申领、ollama环境部署、模型下载、ollama指令、python环境部署、聊天机器人上线、云监控体系搭建、联调测试

rocky linux的安装、目录与文件、解压缩、包管理、服务、以及软件包的安装和卸载

02 系统自动化运维

课程介绍

融合传统Linux高阶运维与AI辅助编程,从零构建扎实的系统管理与自动化脚本开发底座。

能力目标

精通Rocky Linux企业级核心服务配置,熟练运用AI辅助编写Shell脚本和Python脚本实现运维自动化。

主要内容

网络分层模型、抓包利器 Wireshark、物理介质与线缆、Cisco网络仿真软件、构建小型办公室网络、TCP/IP 模型、IP 地址与子网掩码、子网划分

用户与组管理、用户组操作、用户操作、权限管理、umask、特殊权限、属主属组修改、ACL、定时任务、防火墙、NetworkManager、nmcli、网卡启禁、静态IP、top/htop、df、free、nohup、screen、主机名配置

SSH原理与配置、免密登录、远程执行、Rsync语法与定时同步

磁盘结构、文件系统、MBR/GPT分区、LVM逻辑卷、软RAID配置

NFS配置与挂载、Samba跨平台共享、FTP模式与vsftpd权限管理

Chrony时间同步、Rsyslog配置与远程转发、Logrotate日志轮替

SELinux模式与管理、DNS原理、BIND安装与内外网解析配置

Shell变量、环境变量、引号区别、特殊变量、运算符

Shell小工具、判断语句、系统负载巡检、CPU内存磁盘检查、日志安全检查

流程结构、if与case选择、while与for循环、嵌套循环、随机数、免密登录与Web部署案例

Shell函数、正则表达式、expect工具

Shell三剑客、grep指令、sed指令、awk指令

服务器初始化、静态IP配置、SSH加固免密、防火墙批量配置、NTP自动部署、vsftpd与BIND一键部署、日志与错误处理

Python环境搭建、变量、数据类型、运算符、流程控制、数据容器

常用运维模块、os、sys、re、time、shutil、psutil、requests、paramiko

服务器资源监控、CPU内存硬盘监控、邮件状态报告

03 容器与高可用运维

课程介绍

直击企业生产环境高可用痛点,深度剖析Nginx、Keepalived与数据库集群,结合Ansible实现高效自动化运维。

能力目标

掌握企业级高可用集群架构设计与自动化部署,保障核心业务与存储服务的极致稳定。

主要内容

Nginx架构原理、Master/Worker机制

虚拟主机、反向代理、负载均衡

HTTPS、Rewrite、Location

缓存优化、静态资源加速、限流防盗链、企业级高性能优化

高可用架构、Keepalived原理、VRRP协议、VIP漂移机制

Keepalived双机热备、健康检查脚本、Nginx高可用实战

MySQL主从复制、同步原理、Binlog、Relay Log、GTID、主从切换、故障排查、备份恢复、性能优化

Redis持久化、主从复制、故障恢复、哨兵模式、集群部署、数据迁移、内存优化

MySQL与Redis架构、缓存一致性、缓存穿透、缓存击穿、缓存雪崩、综合故障排查、高可用存储实战

Inventory主机管理、Playbook编写规范

Role项目化管理、企业自动化部署实战

企业应用发布流程、滚动发布、蓝绿发布、灰度发布

Nginx日志、Tomcat日志、Java应用日志、Linux系统日志、journalctl、syslog

发布异常排查、生产故障恢复

04 云原生与DevOps交付

课程介绍

引入前沿AI Agent辅助K8s运维,全面覆盖容器运行时到Helm包管理,打造企业级云原生技术壁垒。

能力目标

精通Kubernetes云原生核心组件与容器编排,具备生产级K8s集群部署与微服务流量管理能力。

主要内容

Containerd简介、核心组件、工作流程分层、与Docker关系

Containerd安装、配置、基本命令

Codex安装配置、Codex与ChatGPT区别

官方Skill添加、Skill触发、自定义Skill创建与使用

MCP概述、自定义MCP开发、Tool工具调用、Tool与Skill与MCP区别

传统部署问题、K8s优势与概述、核心组件、集群安装部署、集群管理工具、Kuboard、Rancher、Codex Agent部署实战

节点管理、节点调度、命名空间、Pod基础、亲和性反亲和性、生命周期、重启策略、镜像拉取策略、健康检查、钩子、排错

Controller控制器、Service类型、Metrics-Server、HPA三要素、HPA操作

Ingress控制器、Ingress Controller安装、HTTP案例、HTTPS案例、Traefik部署验证

存储卷分类、PV、PVC、存储动态供给

ConfigMap、Secret、创建使用、subPath、Nginx HTTPS案例

K8s部署挑战、Helm、Chart生命周期、升级回退、仓库管理、Harbor、Chart发布私仓

ECS概述、免费资源、远程连接、RDS配置、数据导入导出

云监控配置、报警规则、Prometheus创建、监控告警通知

SLB配置、CDN申领与加速验证、域名注册解析

Answer平台部署、VPC创建、ACK申请创建、连通性测试、本地访问

05 AI Ops 与 AI Infra运维

课程介绍

聚焦稀缺的AI Infra与AI Ops岗位需求,深度实战GPU集群调度、VLLM推理框架与多智能体协同架构,抢占AI时代高薪风口。

能力目标

掌握GPU算力调度与大模型私有化部署,具备构建Multi-Agent多智能体系统及AI Ops自动化运维体系的能力。

主要内容

Agent架构设计、Hermes部署、MCP工具调用、Prompt工程、Memory机制、RAG知识库、多Agent协同、工作流编排、插件开发、API集成

Prometheus监控、Grafana可视化、Node Exporter、Alertmanager告警、GPU监控、K8s监控、APM、多数据源接入、监控指标管理

日志采集、ELK日志分析、Loki日志平台、告警事件接收、企业微信通知

AI智能分析、根因定位、故障诊断、自动工单生成、自动脚本执行、自动服务恢复、自动巡检、自动报告生成、闭环管理

GPU显卡型号、大模型参数、精度、提示词、token、模型训练、模型应用

GPU驱动安装、CUDA配置、GPU资源查看

vllm推理框架、模型运行优势、nvidia-container-toolkit安装、Docker集成

K8s部署Deepseek、Dcgm-exporter、GPU监控

SmartCloud项目背景、业务场景、Multi-Agent架构、核心技术栈、K8s部署架构、Containerd运行时、功能演示

Milvus部署、PVC存储、连通性验证、ElasticSearch部署、索引配置、Service外部访问

MySQL、MongoDB、Redis、OSS、StatefulSet、Deployment、ConfigMap、Secret、Service暴露、健康与异常排查

镜像构建、Dockerfile优化、ACR推送、Gateway部署、Ingress路由、配置管理、流量分发

五大Agent编排、Dify部署、工作流配置、网络互通、全链路联调、部署排错

Prometheus、Grafana、cAdvisor、Containerd监控、资源看板、日志采集、告警通知

GitLab CI/CD、自动化发布、滚动更新、回滚策略、运维演练、故障排查

06 国家新兴方向

课程介绍

精通麒麟/欧拉操作系统与达梦/高斯数据库,具备党政信创项目端到端容器化交付与运维能力。熟练掌握人形机器人硬件实操、AI智能体配置与系统刷机,具备独立完成商用机器人上门交付的能力。

能力目标

紧扣国家“2+8+N”信创战略,打造“国产OS+国产数据库+K8s”全栈技术闭环,直击政企核心岗位需求。依托原厂真机实训,融合“硬件实操+AI智能体+系统运维”,开辟人形机器人落地交付的全新就业赛道。

主要内容

信创概念、发展历程、2+8+N体系、政策里程碑、技术生态、系统分类

麒麟OS优势、服务器安装、网络与SSH配置、启动流程、systemd、chrony同步

欧拉系统介绍、安装与远程连接、常用命令、网络与防火墙管理

高斯数据库介绍、安装、基本使用、备份还原

DM9概述、应用场景、镜像挂载、命令行安装、初始化数据库、服务注册、环境变量配置

DM9 SQL、DCL权限管理、备份恢复、远程连接

开箱验收、开关机调试、基础按键、规范装箱、模式区分、安全规范、搬动注意事项

灵心平台、智能体创建、素材管理、AI技能编排、APP远程控制、舞台大师编排

系统刷机、Linux日志查询与导出

07 【赠送】网络安全与数据安全(线上录播)

课程介绍

聚焦高阶红蓝对抗与大模型安全稀缺岗位需求,深度实战1:1企业级靶场攻防、C/C++免杀开发与AI大模型安全防御,抢占网络安全顶尖人才高薪风口

能力目标

掌握全链路Web攻防与内网域控渗透,具备构建红队免杀武器化体系及蓝队应急响应与AI大模型安全护栏的能力。

主要内容

网络协议栈、Wireshark流量分析、企业级路由交换、VLAN防环、OSPF动态路由、二层安全防御

防火墙安全域、NAT映射、IPSec/SSL VPN、跨域安全互联

公有云安全组、零信任SASE、系统安全加固、自动化扫描、Nmap资产测绘、Nessus漏洞扫描

Web资产收集、敏感指纹识别、SQL注入、SQLmap绕过WAF

XSS、CSRF、SSRF、Redis利用、文件上传绕过、WebShell免杀、RCE、反弹Shell

反序列化、POP链构造、Shiro、Log4j2、Fastjson、业务逻辑漏洞、JWT绕过、DLP、AI安全护栏

内网架构剖析、BloodHound域拓扑探测、多级内网穿透、FRP/NPS隧道级联

凭证窃取、LSASS提取、本地提权、Bypass UAC、DLL劫持、横向移动、NTLM哈希传递、票据传递

Kerberos协议、金票银票伪造、域控高危漏洞、域控权限维持、Cobalt Strike级联控制

SIEM/ELK部署、自动化告警联动

主机应急响应、PDCERF模型、隐藏挖矿排查、勒索病毒处置

Web日志分析、WebShell查杀、定时任务溯源、内存取证、Volatility、C2流量追踪、攻击画像

安服面试考点、模拟答辩、作品集包装、入职规范

C/C++ Shellcode加载器、PE结构分析、内存加密、API Hashing、静态检测绕过

EDR行为监控、NTDLL Unhook、内存重写、AppLocker绕过、LOLBAS利用、DLL劫持、受信进程注入

跨隔离区靶场实战、外网打点、OA突破、内网凭证获取、横向移动排错、域控提权、KRBTGT Hash读取

红蓝对抗总结报告、安服项目交付答辩

学费价格及优惠咨询

开箱即用

企业级AI智能运维实战项目

极速积累AI运维实战经验,全面搭建AI核心技术栈
构建核心竞争力与坚实的技术护城河

AI智能体项目之星海智伴

项目简介

星海智伴是一套为养老院量身定制的智慧管理系统,面向养老行业数字化转型需求,基于前后端分离架构 + AI 能力构建。项目包含管理后台(Web)和家属端(微信小程序)两端,覆盖养老院“来访参观 → 入住办理 → 在住服务 → 退住办理”的全业务链路。

能力目标

掌握Docker容器化编排与核心中间件运维,具备独立部署AI智能体平台及全链路监控的实战能力。

主要内容

项目全景与架构设计:业务背景剖析、核心技术架构与运维部署拆解

容器基建与编排实战:Docker 核心机制、Dockerfile 构建与 Compose 编排

数据底座与中间件:MySQL 架构调优、自动化备份恢复与 Redis 核心应用

全栈工程化构建:SpringBoot/Vue 前后端打包、配置管理与 Node.js 环境

Nginx 流量网关:核心架构解析、反向代理、静态托管与 Location 路由匹配

RAG 与大模型应用:Embedding 向量化、检索增强生成 (RAG) 与 LLM 智能问答

AI Agent 与 IoT 联动:Dify 平台部署、知识库工作流构建与物联网场景接入

监控体系与可观测性:Prometheus 采集、Grafana 可视化与 AlertManager 告警

AI智能体项目之星海智伴

【实战】K8s生产级项目实战

项目简介

本项目主要围绕星海智伴项目进行容器化编排实战, 要求学员将单体的前后端分离的智能体项目如何升级为基于K8s容器化编排方案, 完成从中间件部署、项目前后端部署、智能体平台搭建、监控平台建设完整的链路处理,并基于此项目能够迭代出更多的类似的项目,形成一举反三的能力, 提高学员问题场景解决能力

能力目标

能够基于容器化完成各个中间件部署

能够基于K8s完成项目Pod构建

能够基于K8s构建Dify平台

能够基于K8s搭建项目监控平台

主要内容

K8s 环境初始化与部署准备:命名空间、YAML、Harbor 凭证、证书配置

服务部署与上线监控:MySQL/Redis 部署、数据库导入、前后端镜像构建、应用发布、Ingress 与监控搭建

项目答疑复盘:行业项目分类介绍、项目话术编写、疑难问题分析

【实战】K8s生产级项目实战

云岚到家微服务项目部署与维护

项目简介

云岚到家是一套面向本地生活服务场景的到家服务平台,主要为用户提供家政、保洁、维修、保养等预约上门服务。平台围绕“用户下单、服务人员接单、平台运营管理、订单履约跟踪”构建完整业务闭环,支持用户端、服务人员端和运营管理端多角色协同使用。

项目采用微服务架构设计,将用户、服务、订单、派单、抢单、支付、营销、公共能力等业务拆分为独立服务,便于后期独立开发、部署、扩容和运维。系统通过网关统一接入请求,使用 Nacos 实现服务注册发现和配置管理,结合 Redis、RabbitMQ、Canal、Elasticsearch、Seata 等中间件完成缓存加速、异步解耦、数据同步、搜索查询和分布式事务控制。

能力目标

掌握微服务架构与 Nacos 注册中心/配置中心部署运维

具备 RabbitMQ、Elasticsearch、Sentinel 等中间件集群运维能力

能搭建 GitLab CI/CD 与 GitOps/ArgoCD 持续交付流水线

掌握 Prometheus/ELK 可观测体系构建与生产故障排查

主要内容

项目介绍与架构设计:软件生命周期、功能模块介绍、业务流程演示、单体与微服务对比、运行环境与分布式集群架构设计

微服务治理与核心中间件:Nacos 注册配置中心、RabbitMQ 消息队列、XXL-JOB 任务调度、Elasticsearch、Sentinel 限流降级熔断

上线交付与 CI/CD 流水线:上线准备、容量规划、高可用部署、联调验收、Git/GitLab、CI Pipeline、ArgoCD GitOps 自动化发布

监控可观测与日志体系:Metrics/Logs/Traces、Prometheus K8s 监控架构、ELK 日志平台、Filebeat/Logstash/ES 采集与优化

云岚到家微服务项目部署与维护

云迁移升级实战

项目简介

本项目聚焦企业级应用的云原生改造与全链路可观测体系建设,包含两大核心模块:
1. 云原生基础设施与微服务架构:基于阿里云(ECS/ACK/VPC等)完成基础设施上云,通过 Docker 与 Kubernetes 实现应用容器化改造、微服务部署与弹性治理;整合 Nacos、Gateway、Redis 等核心中间件,构建高可用的微服务运行环境。
2. 全链路可观测与性能监控:结合 Prometheus + Grafana 构建系统指标监控体系,并引入 SkyWalking + Elasticsearch 建立分布式链路追踪,实现应用性能深度分析与故障快速定位。

能力目标

精通阿里云公有云架构与ACK容器服务,具备企业级微服务项目平滑上云与全链路追踪排障能力。

主要内容

项目架构与云原生上云:云岚到家架构解析、微服务模块拆分、Dockerfile 镜像构建、推送 ACR、K8s Deployment/Service/Ingress 编排

微服务治理与云上配置:Nacos 集群部署与注册配置、Gateway 路由规则与灰度发布、RDS 数据库与 Redis 云上实例连接池配置

可观测性与上云验证:Prometheus + Grafana 监控看板、日志收集与告警规则、SkyWalking 部署与探针埋点、全流程上云验证与故障排查演练

项目疑难复盘:行业微服务项目分类介绍、项目话术编写、项目疑难问题分析

云迁移升级实战

AI Ops 智能化监控项目

项目简介

平台通过构建 Hermes Agent 智能体框架,实现 AI 对基础设施、应用服务及业务系统的统一感知、智能分析和自动化处理能力。通过 MCP(Model Context Protocol)协议连接 Linux 主机、数据库、Kubernetes 集群、监控系统等外部资源,使 AI Agent 具备环境感知、工具调用、任务执行和自动决策能力。

系统整合 Prometheus、Grafana、Alertmanager、ELK、Loki 等可观测组件,实现从 指标采集 → 异常检测 → 智能分析 → 根因定位 → 自动修复 → 工单通知 → 运维闭环 的全流程自动化。

最终打造具备故障自发现、自分析、自恢复能力的新一代智能运维体系,提升企业基础设施稳定性和运维效率。

能力目标

掌握基于 Hermes Agent 与 MCP 协议的 AI 智能体开发及全栈可观测技术,具备构建故障自发现、自分析、自恢复的全流程自动化智能运维闭环体系的能力。

主要内容

AI Agent 架构与能力构建:Agent 架构设计、Hermes 部署、MCP 工具调用、Prompt 工程、Memory 记忆机制、RAG 知识库接入、多 Agent 协同、工作流编排、插件开发与 API 集成

可观测性与监控平台:Prometheus 监控、Grafana 可视化、Node Exporter、Alertmanager 告警、日志采集、ELK / Loki 日志分析、GPU / Kubernetes / APM 监控、多数据源与监控指标管理

AI Ops 智能运维闭环:告警事件接收、AI 智能分析、根因定位 RCA、故障诊断、自动工单 / 脚本执行 / 服务恢复、自动巡检与报告生成、企业微信通知、闭环运维管理

AI Ops 智能化监控项目

AI Infra 模型建设项目

项目简介

本项目聚焦 AI Infra 核心实战,为大模型落地提供云原生算力底座,包含两大模块:
1. 单机算力底座搭建:掌握GPU硬件及大模型核心概念(参数、精度、提示词、Token等),实战完成GPU驱动安装、CUDA环境配置与资源查看。
2. K8s集群部署与监控:在K8s中集成 nvidia-container-toolkit,使用 vLLM 框架部署 DeepSeek 等大模型,并引入 DCGM-exporter 实现 GPU 资源的实时监控。

能力目标

掌握大模型核心概念与GPU底层环境配置,具备在云原生K8s集群中部署大模型推理服务及实现GPU资源实时监控的 AI Infra 算力底座构建能力。

主要内容

GPU 与大模型基础:GPU 硬件型号、模型参数、精度、提示词、Token、模型训练与应用概念

GPU 环境配置与模型部署:GPU 驱动安装、CUDA 环境配置、GPU 资源查看、vLLM 推理框架、Docker GPU 运行时集成、K8s 部署 DeepSeek

GPU 资源监控:基于 DCGM Exporter 实现 GPU 资源监控

AI Infra 模型建设项目

AI SmartCloud多智能体项目部署与维护

项目简介

本项目聚焦企业级 AI 智能体应用与云原生工程化落地,包含两大核心模块:
1. AI 多智能体与混合数据架构:采用 Orchestrator 编排器与五大垂直 Agent 协同架构,基于 LangChain/LangGraph 及 A2A/MCP 协议实现智能客服应答;集成 Milvus+ES 实现混合 RAG 检索,并整合 MySQL/Redis/MongoDB/OSS 构建多层存储体系,保障业务数据高效调用。
2. 云原生微服务部署与自动化运维:基于 K8s+Containerd 实现全服务容器化部署与 FastAPI 统一网关接入;搭建 Prometheus+Grafana 全链路监控告警体系,并构建 GitLab CI/CD 流水线,实现镜像构建、集群发布、滚动更新等全流程自动化交付。

能力目标

掌握多智能体协同架构与混合 RAG 检索技术,具备基于云原生 K8s 实现 AI 微服务全链路部署、全栈监控与 CI/CD 自动化交付的工程化落地能力。

主要内容

SmartCloud 项目与 Multi-Agent 架构:项目背景、业务场景、Orchestrator + 5 大 Agent 架构、核心技术栈、K8s + Containerd 部署架构与功能演示

AI 数据服务与中间件部署:Milvus、ElasticSearch、MySQL、MongoDB、Redis、OSS 在 K8s 中的部署、存储配置、Service 暴露、连通验证与健康检查

应用构建与 Agent 服务发布:微服务 Dockerfile 构建优化、ACR 镜像推送、FastAPI Gateway / Ingress 配置、ConfigMap / Secret 管理、各 Agent 与 Dify 编排联调

可观测性与 CI/CD 运维体系:Prometheus + Grafana、cAdvisor 容器监控、日志采集与告警通知、GitLab CI/CD 流水线、滚动更新回滚与故障排查演练

AI SmartCloud多智能体项目部署与维护

机器人交付工程

项目简介

本项目聚焦人形机器人的标准化交付、智能化配置与现场运维,包含三大核心模块:
1. 硬件实操与标准化交付:熟练掌握机器人开箱验收、上电调试及规范收纳全流程;精准切换站立与力控工作模式,严格遵守操作红线与搬运规范,保障硬件交付的安全与标准化。
2. 智能配置与交互展演编排:依托 LinkSoul 平台完成 AI 智能体创建与交互技能编排,通过“舞台大师”定制动作节目,并结合“灵创 APP”实现移动端远程管控,全面配置机器人的智能交互与展演能力。
3. 系统运维与现场故障排查:掌握机器人标准化刷机升级流程,基于 Linux 环境查询与导出运行日志,能够独立排查设备运行异常,完整覆盖现场调试、部署与日常运维全流程。

能力目标

依托原厂真机实训,融合“硬件实操+AI智能体+系统运维”,开辟人形机器人落地交付的全新就业赛道。

主要内容

机器人开箱验收与基础操作:整机开箱验收、开机调试、基础按键操作、关机断电、规范装箱

运行模式与安全规范:力控模式 / 站立模式实操区分、机身组合键禁用准则、两种运行模式下设备搬动注意事项

平台应用与设备运维:LinkSoul 灵心平台智能体创建、素材资源管理、AI 自定义技能编排、APP 远程控制、舞台大师节目编排、系统刷机与 Linux 日志查询导出

机器人交付工程

江苏传智播客教育科技股份有限公司版权所有

Copyright 2006-2024, All Rights Reserved 苏ICP备16007882号

我要报名 立即咨询