你好。我是梦想歌
专注云原生解决方案的系统架构师擅长 AI Agent、GitOps、平台工程和可观测性。
专注云原生解决方案的系统架构师擅长 AI Agent、GitOps、平台工程和可观测性。
把云资源管起来,把发布链路收起来,把排障路径缩短。能交付,比会描述更重要。
公有云、私有云、Kubernetes 放到同一张视图里,看账、看资源、看风险。
Jenkins、CODING、KubeVela 串起来,研发按权限自己发布。
CAT、Sentinel、Arthas 接进日常流程,出问题先看数据。
年化节约近 200 万
Trace、告警、诊断直接接上
私有云、发布体系、脚手架可复用
把云资源、集群、应用和常用运维操作放进同一个控制台。少切系统,少靠消息确认。
云账号、集群、数据库、应用放在同一张工作台。

资源、集群、应用从这里进入
从资源列表直接看到工作负载,定位入口不再散。

从云资源切到工作负载
发布最怕凭记忆。模板、环境、灰度、回滚和记录,要走同一条路径。
平台维护组件模板,研发少碰 Deployment、Service 细节。
用 App 管环境、配置、依赖和版本,交付对象变清楚。
研发在权限内选版本、发环境、切灰度。
构建、部署、告警、回滚都有记录,生产发布能复盘。

结构和边界直接进模板

发布过程按固定路径走
开源 CAT 能看指标;生产排障还要知道一次请求怎么穿过多个服务。
traceId 跟到服务边界,先判断问题卡在哪一段。

先看请求路径,再看单点指标
慢调用、异常进钉钉,消息里带关键上下文。

异常消息直接进群
限流不是临时按钮。规则保存、历史曲线和峰值复盘都要留下来。
控制台配置不随重启丢,变更能持续生效。

规则、资源、实时流量放在一起
峰值、通过量、拒绝量可回看,事故后能对账。

峰值和拒绝量可回看
把 Arthas 放进 Kubernetes 场景。先选服务和 Pod,再执行 trace、watch、thread。
选服务、选实例,不再手抄容器和命令。

先选 Pod,再进诊断动作
谁能诊断、能看什么、能执行什么,走 RBAC。

诊断入口先过权限
我不喜欢每个项目重搭一遍底座。脚手架负责把边界和默认项放进去。
公共依赖、日志、异常、配置,先给出可用默认项。
领域边界、应用服务、接口层直接进模板。
老业务系统也能按更清楚的层次往前改。
目录、配置、发布方式保持一致,少靠口头约定。

扫码添加,请注明公司+来意