Pelajari
Mengapa agen coding AI tidak cukup untuk aplikasi produksi
Ini bukan argumen menentang agen coding. Mereka unggul pada apa yang mereka kerjakan. Ini adalah inventaris segala hal yang dibutuhkan software produksi yang berada di luar diff, dan siapa yang harus memilikinya.
Agen coding AI mempercepat satu tahap delivery software: menulis dan mengubah kode. Aplikasi produksi juga membutuhkan bukti pengujian, verifikasi keamanan, governansi perubahan, deployment, monitoring, dan respons insiden. Tanggung jawab yang berada di luar penyuntingan kode itu sendiri. Tim yang mengadopsi agen coding tanpa mencakup sisa siklus hidupnya mengirim lebih cepat tetapi beroperasi buta. Celahnya bukan kualitas agennya; melainkan loop delivery di sekitarnya yang tetap harus dimiliki seseorang.
Dipublikasikan 2026-07-03 · Terakhir diperbarui 2026-07-03 · Tim editorial Ciao
Jawaban singkatnya, diperluas
Mari mulai dengan berlaku adil pada kategorinya. Agen coding modern, Cursor, Claude Code, OpenAI Codex, dan rekan-rekannya, adalah alat yang sungguh kuat. Mereka membaca basis kode besar, merencanakan perubahan multi-file, menulis pengujian, memperbaiki kegagalan, dan beriterasi sampai semuanya lolos. Tim engineering yang memakainya dengan baik bergerak jauh lebih cepat, dan tidak ada apa pun di artikel ini yang berargumen sebaliknya. Poinnya soal cakupan, bukan kualitas.
Output agen coding, sebagus apa pun, adalah perubahan pada kode. Software produksi adalah sistem kewajiban tetap yang jauh lebih besar: membuktikan perubahannya bekerja untuk pengguna nyata, memverifikasi ia tidak membawa kerentanan, memutuskan apakah ia diizinkan sama sekali, merilisnya dengan aman, menyadari saat ia berulah, dan merekonstruksi apa yang terjadi ketika ia berulah. Setiap kewajiban itu ada, entah ada yang ditugaskan padanya atau tidak, dan agen coding, yang beroperasi di tahap penyuntingan kode, tidak membebaskan Anda dari satu pun. Ia justru menaikkan tekanan pada semuanya, karena tahap yang ia percepat adalah tahap yang memberi makan semua tahap lainnya.
Maka pertanyaan praktis bagi tim yang menuju produksi bukanlah "apakah agen kami cukup bagus?" melainkan "siapa yang memiliki segala hal di hilir diff, sekarang diff-nya datang lima kali lebih cepat?" Tim dengan organisasi platform yang kuat bisa menjawab dengan infrastruktur yang sudah mereka jalankan. Tim tanpa itu perlu membangun loop tersebut atau mengadopsinya, dan sebaiknya memutuskan dengan sengaja, bukan menemukan celahnya di tengah insiden.
Membantu untuk memperhatikan mengapa celah ini begitu mudah terlewat. Output agen itu hidup, fitur yang bekerja, run pengujian yang lolos, tiket yang tertutup, sementara loop yang hilang tak terlihat sampai ditekan: tak seorang pun melihat pengujian browser yang tidak ada atau jejak audit yang tak pernah ditulis. Keputusan pembelian secara alami membobotkan yang hidup di atas yang tak terlihat. Begitulah organisasi berakhir dengan generasi yang unggul dan delivery yang diimprovisasi. Menuliskan enam kewajiban di bawah ke dalam evaluasi adalah koreksinya; menilai semuanya dengan jujur butuh satu sore, dan keenamnya memprediksi rasa sakit produksi jauh lebih baik daripada benchmark generasi mana pun.
Asimetri kecepatan, dan apa yang diam-diam dirusaknya
Inilah pola yang terus dilaporkan pemimpin engineering. Agen datang; volume pull request melonjak dalam hitungan minggu; dan setiap tahap hilir, tinjauan, QA, keamanan, rilis, mendadak menjadi batasannya. Organisasi lalu hanyut ke salah satu dari dua mode kegagalan. Entah tahap-tahap hilir bertahan dan antrean terbentuk kembali di depannya, artinya perolehan produktivitas menguap menjadi waktu antre; atau tahap-tahapnya mengalah, persetujuan makin ringan, pengujian dilewati "sekali ini saja", dan organisasi itu efektif mengirim kode tanpa tinjauan pada skala besar tanpa pernah memutuskannya.
Mode kedua adalah yang berbahaya karena ia tampak seperti keberhasilan. Lead time turun, dashboard menyala hijau, dan risiko yang menumpuk tak terlihat sampai suatu Selasa yang spesifik: sebuah migrasi yang ditulis agen, disetujui dalam sembilan detik oleh peninjau dengan empat puluh tab terbuka, menjatuhkan alur checkout, dan postmortem-nya menemukan tidak ada pengujian level browser untuk checkout, tidak ada kebijakan yang menandai perubahan skema untuk tinjauan sungguhan, dan tidak ada cara bersih untuk tahu mana dari dua ratus merge minggu itu yang harus di-rollback.
Tak satu pun dari itu adalah salah agennya. Setiap pengaman yang hilang memang sudah hilang sebelum agennya datang; hanya saja dulu lalu lintas di atas jembatannya lebih sedikit. Asimetrinya itulah poinnya: alat yang melipatgandakan produksi kode melipatgandakan konsekuensi dari apa pun yang kurang dari loop delivery Anda.
Jika Anda ingin peringatan dini alih-alih postmortem, pantau empat angka seiring adopsi agen tumbuh: median waktu tinjauan per perubahan yang di-merge (menyusut ke nol adalah gejala, bukan kemenangan), cakupan pengujian atas alur yang membawa pendapatan, waktu rata-rata mengatribusikan masalah produksi ke perubahan penyebabnya, dan porsi deploy dengan jalur rollback yang teruji. Salah satunya bergerak ke arah yang salah selagi volume merge menanjak berarti asimetrinya tiba sesuai jadwal, dan keempatnya lebih murah diperbaiki di bulan kedua daripada di bulan kedua belas.
Apa saja isi kepemilikan produksi di luar diff
Enam kewajiban tetap. Untuk masing-masing, tanyakan: siapa atau apa yang memilikinya bagi kami hari ini, dan apakah ia berskala dengan perubahan berkecepatan agen? Baris yang tak bertuan tidak akan tetap tak bertuan. Ia menjadi insiden dengan nama Anda di atasnya.
- Bukti pengujian, bukan keberadaan pengujian. Verifikasi level browser atas alur pengguna yang membayar tagihan, berjalan pada setiap perubahan, dengan hasil yang bisa Anda ambil kembali kemudian. Agen bisa menulis pengujian; sesuatu harus memiliki tugas menjalankannya sebagai gerbang dan menjaganya tetap jujur seiring aplikasinya berevolusi.
- Verifikasi keamanan terhadap aplikasi yang berjalan. Pemindaian statis dan pemeriksaan dependensi adalah standar minimum; langkah yang menanggung beban adalah mengonfirmasi temuan terhadap aplikasi live sehingga kerentanan sungguhan muncul dari derau. Terus-menerus, karena perubahan kini datang terus-menerus.
- Governansi perubahan. Jawaban eksplisit atas "apakah perubahan ini diizinkan?": kebijakan yang mengklasifikasikan perubahan berdasarkan area bisnis dan risiko, zona terlindungi untuk auth dan pembayaran, persetujuan manusia tercatat di titik yang penting, dan jejak audit yang bertahan melewati pergantian personel.
- Deployment sebagai tahap terkendali. Gerbang smoke sebelum publish, verifikasi sesudahnya, environment yang serasi, dan rollback sebagai operasi satu langkah. Jalur publish adalah tempat kode menjadi konsekuensi; ia layak mendapat lebih banyak seremoni daripada perintah terminal, bukan lebih sedikit.
- Monitoring dan diagnosis. Sesuatu yang mengawasi aplikasi live, DNS, CDN, dan dependensinya, dan mampu mendiagnosis akar penyebab, bukan sekadar mem-paging manusia dengan grafik merah pukul 2 pagi.
- Visibilitas fleet. Begitu AI membuat aplikasi jadi murah, Anda akan punya banyak. Seseorang butuh satu layar yang menunjukkan apa yang ada, siapa pemilik tiap aplikasi, dalam kondisi apa ia berada, dan perubahan mana yang menunggu tinjauan, atau portofolionya sendiri menjadi shadow IT.
Loop delivery: yang tercakup vs yang tersisa
Di mana agen coding membantu pada tiap tahap, dan apa yang masih dituntut produksi dari Anda. Ini mendeskripsikan cakupan kategorinya, bukan langit-langit produk tertentu. Perlakukan sebagai latihan penugasan tanggung jawab: taruh sebuah nama di kolom kanan untuk setiap baris sebelum Anda menskalakan adopsi agen.
| Tahap siklus hidup | Kontribusi agen coding | Yang masih dituntut produksi dari Anda |
|---|---|---|
| Implementasi | Unggul: perubahan multi-file, refactor, perbaikan | Arah, arsitektur, selera |
| Pengujian | Bisa menulis pengujian bila diminta | Gerbang yang berjalan pada setiap perubahan dan memblokir publish yang buruk |
| Keamanan | Bisa memperbaiki isu yang ditandai | Pemindaian berkelanjutan, verifikasi live, kepemilikan triase |
| Tinjauan & governansi | Bisa merangkum dan menjelaskan diff | Kebijakan, zona terlindungi, persetujuan tercatat yang akuntabel |
| Deployment | Bisa menulis konfigurasi pipeline | Pipeline-nya sendiri: gerbang, environment, rollback |
| Monitoring | Bisa membantu debug bila diminta | Pengamatan tetap, diagnosis, respons insiden |
| Audit & kepatuhan | Pesan commit | Jejak prompt-ke-produksi yang diterima auditor Anda |
Dua cara jujur menutup celahnya
Jalur satu: rakit loop-nya sendiri. CI dengan gerbang sungguhan, infrastruktur pengujian browser, pemindaian keamanan yang tersambung ke sesuatu yang memverifikasi temuan, kebijakan tinjauan yang benar-benar ditegakkan tim Anda, otomasi deployment dengan rollback, observabilitas, dan perekat yang membuat perubahan hasil agen mengalir melalui semuanya. Ini jalur yang sah, inilah yang dilakukan tim platform yang kuat, dan biayanya adalah investasi engineering permanen, bukan pembelian. Jika Anda punya organisasi platform untuk membangun dan memeliharanya, agen coding di dalam loop itu adalah kombinasi yang hebat.
Jalur dua: adopsi platform di mana loop-nya adalah produknya, dan generasinya terjadi di dalamnya. Inilah pertukaran yang sebaiknya dievaluasi dengan jujur oleh kebanyakan tim tanpa organisasi platform: kontrol bespoke yang lebih sedikit dibanding membangun sendiri, ditukar dengan pengujian, governansi, keamanan, deployment, dan monitoring yang ada sejak hari pertama dan berskala dengan volume perubahan secara desain. Kedua jalur juga bukan musuh. Banyak organisasi menjalankan engineer dengan agen coding pada sistem inti mereka dan platform tergovernansi untuk ekor panjang aplikasi bisnis yang selamanya tak akan tersentuh perhatian tim platform.
Heuristik yang adil untuk memilih di antara kedua jalur: hitung engineer platform Anda dan aplikasi Anda. Tim platform yang kuat yang menopang segelintir sistem inti sangat bisa membangun loop-nya, dan mungkin memang sebaiknya. Tim yang sama, bila diminta merentangkan loop itu ke puluhan aplikasi departemen, portal buatan agensi, dan warisan akuisisi, akan tenggelam. Ekor panjang itulah tempat keputusan membeli biasanya membayar dirinya sendiri. Dan kedua jalur bisa dikomposisikan: mengadopsi platform untuk portofolionya tidak menuntut apa pun untuk meninggalkan pipeline yang sudah dipercaya produk inti Anda.
Di mana posisi Ciao
Ciao adalah jalur dua, dibangun dengan sengaja. Setiap workspace mendapat organisasi software AI. CTO, Doctor, analis QA, engineer Security, Coder, dan operator SysOps. Sehingga peran-peran yang memiliki loop itu ada sejak prompt pertama. QA menjalankan pemutaran ulang browser deterministik, pengujian yang menyembuhkan diri, gerbang smoke sebelum publish, dan pemeriksaan produksi setelah publish. Security menjalankan pemindaian statis, pemeriksaan dependensi, dan probe kontrol akses, serta mengonfirmasi kerentanan terhadap aplikasi live sebelum menandainya. Guardrails menerapkan kebijakan berbahasa sederhana, mencatat tinjauan manusia, dan meninggalkan jejak audit di balik setiap merge. Doctor, AI SRE read-only, menyelidiki aplikasi live, DNS, dan CDN, mendiagnosis akar penyebab, dan menyusun perbaikannya, dan Conductor memberi satu layar untuk seluruh fleet.
Dan karena tahap penyuntingan kode tidak seharusnya menjadi taman berpagar: aplikasinya React, TypeScript, dan Supabase nyata dengan kepemilikan 100%, bisa diekspor ke repositori Anda sendiri kapan saja, dan image sandbox kustom membungkus siklus hidup yang sama di sekitar backend Rails, Java, Go, Python, Node, dan multi-proses. Deploy ke cloud Ciao, akun AWS, Azure, atau GCP Anda sendiri, VPC privat, atau on-prem di bawah ketentuan terpisah. Program pengembangan serius dimulai dari USD 10.000 per tahun, dan demo yang paling berguna, jika artikel ini terasa mengena, adalah menyaksikan satu perubahan menempuh seluruh loop dari prompt sampai produksi yang termonitor.
Pertanyaan yang sering diajukan
Apakah Anda mengatakan agen coding AI adalah alat yang buruk?
Tidak. Mereka unggul pada tahap yang mereka tangani, dan artikel ini mengasumsikan Anda tetap memakainya. Argumennya tentang segala hal di hilir diff: pengujian, governansi, deployment, monitoring, dan audit adalah kewajiban yang kebutuhannya justru dipercepat oleh agen, bukan dihapus.
Agen kami juga menulis pengujian. Bukankah itu menutup celah pengujiannya?
Itu menutup paruh penulisannya. Paruh produksinya bersifat sistemik: pengujian harus berjalan pada setiap perubahan, menggerbangi publish secara default, mencakup alur pengguna sungguhan di level browser, dan menghasilkan bukti yang bisa Anda ambil kembali saat audit atau insiden. Itu infrastruktur dan kebijakan, bukan generasi kode.
Bisakah kami cukup menambahkan CI/CD di sekitar agen coding kami dan menganggapnya selesai?
CI/CD adalah bagian nyata dari jawabannya dan layak dikerjakan bagaimanapun juga. Potongan yang biasanya hilang adalah governansi. Triase berbasis kebijakan atas perubahan mana yang butuh persetujuan manusia tercatat. Pengujian keamanan terverifikasi live, monitoring produksi dengan diagnosis, dan jejak audit prompt-ke-produksi. Nilai loop Anda terhadap keenam kewajiban itu, bukan hanya pipeline-nya.
Apakah Ciao menggantikan agen coding kami?
Tidak harus. Banyak organisasi mempertahankan engineer dan agen pada sistem inti sambil menjalankan delivery aplikasi tergovernansi di Ciao. Terutama untuk ekor panjang aplikasi bisnis yang tak pernah terjangkau tim platform. Coder milik Ciao sendiri bekerja di dalam loop yang sama, dan sandbox kustom membawa sistem Rails, Java, Go, Python, dan Node yang ada ke dalamnya.
Bagaimana kami tahu apakah kami sudah punya masalah ini?
Tiga pertanyaan dari sebulan terakhir pengiriman Anda: berapa persen perubahan yang di-merge mendapat tinjauan manusia atau kebijakan yang bermakna, apakah alur checkout yang rusak akan tertangkap sebelum pengguna menemukannya, dan bisakah Anda menghasilkan jejak persetujuan untuk satu perubahan produksi tertentu dalam waktu kurang dari satu jam? Dua jawaban tak nyaman atau lebih adalah tanda tangannya.
Berapa biaya loop penuhnya di Ciao?
Builder individu bisa mulai self-serve dengan kredit, dan program produksi serius dimulai dari USD 10.000 per tahun. Perbandingan yang relevan jarang di baris lisensinya; melainkan investasi platform engineering yang dibutuhkan untuk merakit dan memelihara loop setara sendiri, yang bisa dibantu sales untuk Anda modelkan dengan jujur.