タグ: SRE
「SRE」に関連する記事を表示しています。
600万DAUの裏側で起きる落とし穴:急拡大サービスのSLO形骸化を防ぐ方法
急成長プロダクトの裏でSLOやIaCの整備が追いつかない落とし穴を、Meta「Muse」の事例をきっかけにSRE視点で解説します。
CS・IT・セキュリティ人材の採用基準を職務要件から逆算する方法
CS・CE・IT・セキュリティの専門領域の違いを、採用要件やチーム編成の判断軸として整理しました。
Prometheus・Grafana・Loki構成が月次障害を生む理由と対策
自前監視基盤が5系統のOSS運用になり形骸化する仕組みと、カーディナリティ確認やメタ監視など具体的な点検方法を整理しました。
LiteLLMからAIゲートウェイを乗り換える基準、p99遅延33秒の実測値で判断する
LiteLLMとBifrostの実測ベンチマークをもとに、AIゲートウェイの乗り換え判断基準をSREの視点で整理しました。
Anthropic×Accenture提携、SREが見るべき本番運用の壁
AnthropicとAccentureの提携をSRE視点で解説。マルチクラウド対応のIaC設計やオブザーバビリティ統合など、AI本番運用で確認すべき点を整理しました。
MCP接続構成の選び方: サーバー・コネクタ運用監視の判断基準
MCPサーバーを自前運用するか既存コネクタを使うか、監視・障害対応・運用コストの観点から判断軸を整理しました。
AI基盤の安全指針を読む前に確認すべきSREの落とし穴3つ
AI企業間の安全性方針の対立は他人事ではなく、LLM APIを使うシステムのSLOやオブザーバビリティに影響します。確認方法と対策手順を整理しました。
AWS App Mesh 廃止、2026年9月までに40サービスをどう移すか
AWS App Mesh廃止(2026年9月)に伴う移行の落とし穴を、メッシュとゲートウェイの分離という設計観点から解説し、確認手順と移行フェーズを整理しました。
検索改善でPostgreSQL負荷が急増する落とし穴とSLO設計の対策
検索機能をハイブリッド検索に刷新する際、精度指標だけを追ってSLOやフォールバック設計を後回しにすると障害につながります。原因と対策を整理しました。
AI SREでMTTRは本当に減るか 効果が出る所と出ない所の見極め方
AI SREはMTTR全体でなく調査区間を縮める仕組みです。効果が出る条件と確認方法、導入手順を整理しました。
社内向けAIチャットボットをRAGで作る前に決める4つの可用性設計軸
社内チャットボット導入で迷うRAG・アーキテクチャ選定を、SLO・IaC・オブザーバビリティの観点から4つの判断軸で整理しました。
Reviactyl検証:自前ゲームサーバー基盤をDockerで内製運用する判断基準
オープンソースのゲームサーバー管理パネルReviactylを題材に、Docker基盤のセルフホスト運用における監視設計・障害対応の確認ポイントを整理しました。