项目管理
-
云服务性能下降事件分析:高可用架构与可用区疏散实践
10 月 22 日星期一,某海外云服务商发生了一次服务故障。由于该故障导致多个热门网站宕机数小时,事件引发了广泛关注。某海外流媒体服务提供方也受到了一定影响,但对终端用户造成的实际影响较小。 从高可用架构、故障隔离和可用区疏散的角度来看,这次事件具有较强的参考价值。回顾此次事件,我们有一些应对措施做…
-
共享事故复盘如何提升客户可靠性:SRE 与 CRE 实践经验
本文将探讨如何与受影响的客户共同回顾事故分析报告,从而获得更具可操作性的洞察,并帮助客户改进其系统架构和运维实践。对于采用 SRE 体系的团队而言,事故复盘、服务等级目标(SLO)和错误预算不仅能帮助平台方改进服务,也能帮助客户提升自身系统的可靠性。文中还将提供一个基于通用 SRE 事故分析报告模板…
-
SRE 事件管理实践:一次故障响应、回滚与事后复盘的真实案例
你有没有想过,当一家大型海外互联网公司的核心服务出现问题时,内部会如何进行 SRE 事件管理和故障响应?在技术行业里,我们常用“救火”来形容处理线上故障的过程。 当然,和真正的消防员不同,工程师面对的大多数事件通常不会直接危及生命安全。尽管这个比喻并不完全贴切,但 SRE(站点可靠性工程师)与其他领…
-
团队文化如何提升软件交付效率:为什么拥抱失败能推动高绩效
事情总会出错,这就是现实。当软件交付结果不如预期时,真正重要的不是失败本身,而是团队接下来如何应对。对于希望提升软件交付效率、DevOps 实践水平和组织绩效的团队来说,能否正确面对失败,往往决定了团队能否持续成长。 海外某些技术研究团队的研究表明,那些鼓励信任的团队文化——允许提出质疑、支持合理冒…
-
如何衡量开发者生产力:DORA、SPACE、Core 4 与 AI 衡量框架实践指南
大多数工程领导者都会面对同一个问题:我的团队到底有多高效?尤其是在 AI 正在改变软件开发方式的今天,如何衡量开发者生产力、提升研发效能和工程效率,已经变得更加复杂。 对于希望优化软件开发流程的组织来说,衡量开发者生产力非常重要。但传统指标,例如代码行数、提交次数、完成的问题数量,往往无法真正反映团…
-
如何管理错误预算:提升服务可靠性与 SLO 达成率的实践经验
客户可靠性工程中的错误预算管理方法 错误预算是服务可靠性管理中的重要工具,它可以帮助团队在功能发布速度与系统稳定性之间取得平衡。当服务超出服务级别目标(SLO)时,团队不应只依赖直觉决策,而应通过错误预算消耗分析,判断问题来源,并采取合适的发布控制、可靠性改进和风险缓解措施。对于研发团队而言,借助 …
-
开发者生产力指标:16 项研发效能衡量方法
工程领导者早已意识到,衡量开发者生产力,远不只是统计代码行数、提交次数或已完成的问题数量。对于希望提升研发效能和工程效率的团队来说,真正有价值的开发者生产力指标,应该同时关注交付速度、软件质量、开发者体验和最终业务影响。 如今,一些高效工程团队正在把系统指标与开发者反馈结合起来,从而更全面地理解工程…
-
运用 SRE 原则降低生产事故影响:CRE 实战经验与可靠性优化方法
如果你运营任何类型的互联网服务,就会知道生产事故几乎不可避免。无论架构设计多么稳健,发布流程多么严谨,最终总会有某些因素叠加失控,导致客户无法正常使用你的服务。 你努力打造用户喜爱的产品,不断推出新功能,既是为了提升现有用户的满意度,也是为了吸引更多新用户。然而,发布新功能,或者引入任何形式的变更,…
-
DevOps 四项关键指标:如何衡量团队研发效能是否达到精英水平?
想判断一个 DevOps 团队的软件交付能力是否优秀,不能只依赖主观感受,而应通过可量化的研发效能指标进行评估。经过多年研究,海外某 DevOps 研究团队提出了四项能够反映软件交付团队绩效的关键指标: 部署频率:组织成功将代码发布到生产环境的频率。 变更前置时间:从代码提交到正式发布所需的时间。 …
-
可观测性平台迁移实践:从供应商依赖到自主掌控的经验教训
如何通过一次复杂的大规模可观测性平台迁移,转向内部可观测性平台,获得更好的工具、更一致的数据,并从根本上重塑开发者体验。 可观测性,是指通过指标、日志和链路追踪等数据,了解应用程序的性能与可靠性状态。对任何一家公司的基础设施团队而言,可观测性都是最重要的能力之一。没有一个可靠、成本可控且易于使用的可…