Kerangka Kerja IBM Well-Architected

Sebuah persegi panjang 3D berwarna biru dengan ikon power berwarna putih di atasnya, dengan latar belakang putih.
Ikhtisar

Pilar Operasi Efisien berfokus pada solusi yang memenuhi persyaratan untuk memperoleh insight dari beban kerja cloud, mendukung proses digital, dan mempertahankan postur operasional yang proaktif. Hal ini dicapai melalui praktik dan panduan terkait penerapan tim, otomatisasi, serta penggunaan alat AI untuk memantau, mengelola, dan memelihara solusi secara aman, andal, dan berkinerja tinggi.

Prinsip

Contoh model operasional termasuk “Anda membangunnya, Anda menjalankannya” atau penerapan praktik rekayasa keandalan situs. Model operasional ini dan model lainnya bergantung pada pemahaman terhadap kebutuhan dan konteks bisnis, pelanggan, administrator, serta tim pengembangan.

Penting untuk dipahami bahwa model operasi harus terus dinilai, disesuaikan, dan diadaptasi dengan kebutuhan organisasi dengan mempertimbangkan faktor-faktor seperti industri, persyaratan regulasi, solusi yang ada, serta tujuan pengguna.

Mengotomatiskan tugas operasi yang umum dan rutin menggunakan skrip, agen cerdas, serta alat lainnya membantu mempertahankan tingkat layanan yang tinggi.

Prinsip ini harus ditingkatkan di seluruh tim dan dependensi untuk mencapai efisiensi serta kecepatan menyeluruh, meningkatkan akurasi, mengurangi kesalahan, meningkatkan ketangkasan, dan memastikan konsistensi dalam lingkungan operasi.

Saat ini tim operasi memiliki banyak pilihan alat operasional dan dapat memilih berbagai alat terbaik untuk aspek operasional tertentu, yang dapat menyebabkan penyebaran alat jika tidak dikelola dengan baik.

Variasi dan integrasi di berbagai alat dapat menimbulkan tantangan dalam proses orientasi anggota tim, lisensi dan pengendalian biaya, ketangkasan, serta peningkatan kerentanan. Tim operasi harus terus berupaya meminimalkan dan mengonsolidasikan alat serta konsol operasional yang digunakan.

Tidak setiap solusi memerlukan ketersediaan 24 × 7 atau waktu respons instan. Solusi yang efisien harus mendukung beberapa tingkat layanan dalam satu solusi dan memungkinkan beban kerja ditempatkan pada infrastruktur yang paling memenuhi persyaratan operasi beban kerja.

Tingkat layanan juga akan memberikan panduan bagi tim pengembangan untuk memperhitungkan konfigurasi tingkat aplikasi dan instrumentasi guna mendukung tujuan bisnis serta menghadirkan pengalaman pengguna yang positif.

Tim operasi yang efisien bersifat multidisiplin, yaitu mencakup semua keterampilan yang dibutuhkan untuk mendukung serangkaian aplikasi. Pencapaian kemampuan ini memerlukan pertimbangan di seluruh tumpukan beban kerja, termasuk layanan aplikasi dan infrastruktur.

Solusi dan peralatan operasi harus mendukung model ini dengan memungkinkan integrasi (lintas komponen solusi) serta pemisahan (dari solusi lain) alat operasi dan informasi.

Apa yang dimaksud dengan rekayasa keandalan situs?

Banyak praktik operasional bersifat umum dan dapat diotomatisasi serta diakses melalui API untuk memberikan akses yang lebih luas. Misalnya, tidak hanya membuat otomatisasi untuk mengelola rahasia, tetapi juga menyediakan API yang berjalan terus-menerus untuk menjalankan operasi manajemen rahasia.

Pendekatan ini dapat diskalakan di seluruh proses on-boarding kemampuan baru serta integrasi ke dalam alur kerja yang dinamis. Pendekatan ini juga dapat menstandarisasi prosedur dan mengurangi waktu tunggu antar tim.

 

Praktik

Praktik dan panduan ini dirancang untuk menciptakan solusi operasional yang efisien. Panduan tersebut memberikan arahan bagi tim untuk menerapkan prinsip-prinsip operasi yang efisien serta memastikan keandalan, ketersediaan, dan kinerja sistem yang kompleks. Praktik-praktik ini membantu organisasi mencapai tujuan keandalan yang berpusat pada pengguna sekaligus menjaga kesehatan layanan mereka.

Praktik operasi yang efisien bersifat fleksibel dan dapat disesuaikan dengan skala yang tepat untuk memenuhi kebutuhan spesifik serta konteks konsumen, sistem, dan layanan organisasi.

Persyaratan khusus organisasi, beban kerja, dan arsitektur akan menentukan praktik terbaik yang perlu diadopsi. Peningkatan berkelanjutan melalui masukan, penilaian, serta penyelarasan dengan strategi cloud organisasi sangat penting untuk menjaga efisiensi dan efektivitas secara berkelanjutan.

Hasil yang diinginkan adalah terciptanya budaya keandalan dan kolaborasi yang meningkatkan pengalaman pengguna, mendorong nilai bisnis, dan meminimalkan gangguan.

Setiap aplikasi cloud dengan tim administratif atau SRE sendiri cenderung mengadopsi atau membangun solusi pemantauan. Untuk meminimalkan control plane, tim operasi sebaiknya bekerja sama dengan tim alat terpusat untuk mengadopsi solusi pemantauan terpusat.

Mengkonsolidasikan log sistem, peristiwa, dan aplikasi ke lokasi pusat sangat menyederhanakan pemantauan operasional serta diagnosis masalah dengan meminimalkan jumlah sumber log dan lokasi yang harus dipantau dan dikelola oleh staf operasi. Hal ini memungkinkan tim menyiapkan sistem pemantauan yang komprehensif untuk terus mengumpulkan dan menganalisis metrik serta log dari berbagai komponen sistem. Sistem ini memicu peringatan ketika SLI menyimpang dari rentang yang dapat diterima, memungkinkan insinyur atau proses otomatis merespons dengan cepat untuk mengatasi sinyal indikatif tersebut.

IBM Observability with Instana IBM Cloud Pak for AIOps

Model “break-fix” lama tidak efektif di lingkungan TI modern yang menghadapi permintaan pelanggan yang lebih tinggi, solusi multi-cloud yang luas, dan keterbatasan jumlah staf terampil untuk mengelolanya. Alat operasi berbasis kecerdasan buatan (AIOps) membantu tim operasi menjaga ketersediaan, kinerja, dan keamanan lingkungan mereka, serta memungkinkan identifikasi dan penyelesaian masalah potensial secara cepat dan berkelanjutan.

Mengadopsi AIOps diaktifkan melalui kegiatan utama termasuk:

  • Pengumpulan data di seluruh proses operasional, seperti insiden, masalah, dan perubahan
  • Pelatihan model selaras dengan SLOs dan SLI
  • Deteksi dan triase otomatis di seluruh layanan individual dan terintegrasi
  • Respons otomatis dan remediasi untuk mengaktifkan sistem penyembuhan mandiri
  • Masukan dan pembelajaran berkelanjutan
IBM Cloud Pak for AIOps

Spesifikasi dan konfigurasi infrastruktur dikelola seperti kode, yaitu ie. menggunakan alat penyediaan otomatis untuk memungkinkan manajemen konfigurasi serta memastikan konsistensi infrastruktur di seluruh penerapan.

Konfigurasi infrastruktur yang konsisten dalam kode memastikan lingkungan yang dapat direproduksi sepanjang siklus hidup SDLC dan penerapan di seluruh lingkungan.

Pendekatan ini memungkinkan manfaat utama termasuk:

  • Tata kelola, auditabilitas, dan kontrol versi memanfaatkan sistem seperti Git
  • Memungkinkan kolaborasi serta kemampuan untuk mengembalikan perubahan saat diperlukan
  • Otomatisasi dan kecepatan penyediaan dan pengelolaan sumber daya
  • Skalabilitas sesuai dengan ambang batas dan pemicu
  • Kegunaan ulang di seluruh tim dan proyek

 

Ansible

Tim produk bekerja sama dengan pemangku kepentingan untuk menentukan Service Level Objectives (SLO) dan menetapkan Service Level Indicators (SLI) yang mengukur ketahanan serta penyampaian layanan. SLA mungkin memiliki banyak kaitan dengan SLO, yang menggunakan metrik terukur seperti latensi, tingkat kesalahan, dan waktu aktif untuk mendukung pencapaian tujuan yang telah ditetapkan.

Pembentukan SLOs dan SLI memungkinkan manfaat utama termasuk:

  • Tujuan yang terukur untuk memastikan tim memiliki target yang jelas dan terdefinisi dengan baik
  • Fokus yang berpusat pada pengguna berdasarkan harapan bisnis dan pengalaman pengguna
  • Pengukuran yang terukur memungkinkan evaluasi dan penilaian yang objektif
  • Panduan dalam menyelaraskan kualitas layanan saat menggunakan vendor eksternal
  • Pengukuran umum di seluruh tim (pengembangan, operasi, bisnis)

Secara konsisten kembangkan prosedur yang menguraikan peran, tanggung jawab, saluran komunikasi, serta jalur eskalasi selama proses utama seperti manajemen insiden, perubahan, dan masalah. Prosedur ini memastikan penggunaan sumber daya cloud yang fungsional, aman, dapat diskalakan, dan hemat biaya.

Prosedur Operasi Cloud yang umum meliputi:

  • Provisi dan Penerapan berdasarkan templat Infrastruktur sebagai Kode yang telah ditentukan sebelumnya
  • Pemantauan dan Pemberitahuan untuk memberi tahu tim ketika ambang batas atau parameter kesehatan dilanggar
  • Membuat cadangan data dan konfigurasi secara teratur untuk memungkinkan rencana pemulihan yang kuat dan tepat waktu
  • Memantau pemanfaatan sumber daya dan mengidentifikasi peluang pengoptimalan biaya
  • Melakukan tes pemulihan bencana secara teratur untuk memvalidasi efektivitas rencana pemulihan
  • Menganalisis tren penggunaan dan pertumbuhan untuk Forecasting kebutuhan Resources
  • Mengembangkan rencana respons insiden untuk alamat peristiwa penting seperti pemadaman dan pelanggaran

Implementasi dan pengelolaan prosedur yang terdefinisi dengan baik mencakup simulasi proses untuk meniru berbagai skenario serta memastikan tim dipersiapkan dengan baik untuk mengeksekusi di seluruh regu dengan kualitas dan efisiensi.

Setelah insiden tak terduga terjadi, tim melakukan penyelidikan postmortem yang bersifat tanpa menyalahkan (blameless) untuk mengidentifikasi faktor-faktor yang berkontribusi, akar masalah, serta efisiensi respons. Proses ini kemudian diikuti dengan penerapan solusi digital dan/atau otomatisasi untuk mencegah insiden serupa di masa depan.

Praktik ini mencakup peninjauan rutin dan penyempurnaan berdasarkan insight berbasis data, postmortem, serta masukan dari para pemangku kepentingan. Selain itu, karena layanan tersedia dan diintegrasikan ke dalam lingkungan, integrasi dengan solusi otomatis yang sudah ada menjadi kunci untuk mempertahankan postur proaktif.

Solusi ini memastikan bahwa proses tidak boleh tetap statis, melainkan berkembang untuk memenuhi tujuan, persyaratan, dan tantangan bisnis yang dinamis.

Berkolaborasi dengan tim keamanan untuk memastikan bahwa langkah-langkah keamanan terintegrasi ke dalam proses pengembangan, penerapan, dan pemeliharaan.

Langkah ini mencakup pendekatan shift-left terhadap keamanan dan Siklus Hidup Pengembangan Perangkat Lunak (SDLC), dengan fokus pada penerapan kebijakan melalui solusi yang dikodekan dan diotomatisasi.

Kolaborasi yang konsisten dengan tim keamanan memastikan bahwa beban kerja yang digunakan tetap selaras dengan kebijakan organisasi yang dinamis serta tujuan bisnis. Proses lain mencakup penggunaan penilaian keamanan secara berkala, penerapan manajemen kerentanan, serta pelaksanaan pemeriksaan kepatuhan secara rutin.

 

Sumber daya IBM Cloud Pak for AIOps
platform manajemen operasi komprehensif yang didukung AI yang membantu tim operasi mengontekstualisasikan data operasional, memecahkan masalah secara kolaboratif, serta memberikan rekomendasi proaktif untuk membantu tim menghindari masalah sebelum terjadi.
IBM Instana Observability
platform observabilitas operasi seluruh tumpukan yang mengintegrasikan tim operasi melalui platform bersama dan tampilan kontekstual yang mendukung semua tim pengiriman, termasuk DevOps, SRE, rekayasa platform, dan ITOps.
IBM Turbonomic
platform visualisasi seluruh tumpukan dan otomatisasi operasi yang membantu tim operasi mengoptimalkan sumber daya infrastruktur untuk biaya dan kinerja.
IBM DevOps Automation
alat perangkat lunak cerdas yang membantu tim untuk mengirimkan perangkat lunak dengan lebih efisien.
Red Hat Ansible
platform otomatisasi hybrid cloud mengotomatiskan tugas berulang untuk menghemat waktu dan menjadi lebih produktif.
OpenShift Pipelines
solusi cloud-native, integrasi berkelanjutan dan pengiriman berkelanjutan (CI/CD) berbasis sumber daya Kubernetes yang berjalan di Red Hat OpenShift, sehingga dapat diterapkan dan digunakan di mana saja dalam lingkungan cloud hybrid.
OpenShift GitOps
OpenShift GitOps adalah cara deklaratif untuk menerapkan penerapan berkelanjutan untuk aplikasi cloud native.
Tim multi-disiplin, tim yang selaras dengan aplikasi
Apa itu rekayasa keandalan situs (SRE)? memberikan gambaran umum tentang SRE dan perannya dalam solusi cloud hybrid.
Pilar Kerangka Kerja yang Dirancang dengan Baik Hybrid dan Portabel Ketahanan Keamanan dan Kepatuhan Kinerja Operasi Keuangan dan Keberlanjutan
Langkah selanjutnya