Kami Menjalankan Seluruh Library Strategi Kami Lewat Gauntlet Validasi — Ini yang Berhasil Bertahan

Sebagian besar platform trading hanya menampilkan backtest yang menang. Grafik naik ke kanan, Sharpe ratio terlihat menjanjikan, dan ribuan varian yang gugur sebelum screenshot itu diambil tidak pernah ditampilkan.
Artikel ini tentang kuburan tersebut. Bukan karena kegagalan itu menarik pada dirinya sendiri — tapi karena kuburan adalah satu-satunya tempat kamu bisa memverifikasi apakah sebuah proses validasi benar-benar menolak sesuatu — termasuk, ketika pengujian makin ketat, karya yang sudah diterbitkan platform itu sendiri.
Dari sepuluh sesi discovery mingguan yang bisa Anny rekonstruksi secara penuh, engine-nya mengevaluasi 8.610 kandidat strategi. 36 lolos dari gauntlet validasi penuh — 0,42%. Dari jumlah itu, 8 benar-benar dipublikasikan ke library. Kemudian Anny membangun serangkaian pengujian yang lebih ketat, mengarahkannya ke strategi-strategi yang sudah dipublikasikan, dan 10 dari 15 strategi di live library mendapat tanda peringatan.
Semua ini diterbitkan — termasuk bagian di mana Anny menemukan bahwa engine-nya sendiri punya bug yang berarti ia tidak pernah menelusuri sepertiga dari keluarga strategi yang diklaim sudah dicari.
Gauntlet ini, dalam bahasa yang mudah dipahami
Setiap kandidat strategi — satu set aturan, pada satu koin, pada satu timeframe — harus melewati serangkaian filter secara berurutan. Ketika sebuah strategi gagal, ia gagal di filter yang bernama, dan setiap filter ada untuk melindungi dari satu cara spesifik backtest bisa berbohong:
Sanity gates. Jumlah trade yang cukup untuk bermakna (minimum 30), batas drawdown 35%, dan return minimum yang disesuaikan risiko. Membosankan, dan bertanggung jawab atas sebagian besar eliminasi — lebih lanjut di bawah.
Walk-forward. Sebuah backtest bisa menghafal masa lalu. Walk-forward menyembunyikan sebagian sejarah dari strategi, lalu memeriksa performanya pada bagian yang belum pernah dilihat. Anny mensyaratkan strategi mempertahankan setidaknya 50% performanya pada data tak terlihat — jika tidak bisa, angka backtest yang cantik itu adalah keberuntungan, dan Anny menyatakannya demikian.
Trade-sequence bootstrap. Backtestmu menampilkan satu versi sejarah. Anny memutar ulang trade-trade strategi dalam 500 urutan yang diacak — 500 semesta alternatif — dan melihat skenario terburuk yang mungkin terjadi. Jika 1 dari 20 semesta menghasilkan drawdown yang akan membuatmu berhenti, kamu seharusnya tahu itu sebelum uang nyata terlibat. Pengujian yang sama juga menangkap kebalikannya: strategi yang sejarah nyatanya lebih beruntung daripada hampir semua reshuffling-nya sendiri.
Plausibility cap dan divergence bound. Jika sebuah strategi mendapat skor terlalu sempurna, Anny menolaknya — karena hasil yang "tidak masuk akal" hampir selalu merupakan kesalahan data atau keberuntungan, bukan penemuan sejati. Dan jika skor sesi latihan dan skor data tak terlihat berbeda jauh ke arah manapun, Anny menandainya: kamu tidak bisa mempercayai angka manapun.
Breadth. Strategi yang hanya pernah berhasil pada satu koin kemungkinan besar adalah cerita tentang koin itu, bukan sebuah strategi. Ketika aturan yang sama secara independen bertahan pada banyak aset, itu adalah bukti bahwa edge-nya nyata.
Funnel-nya, dengan bagian yang canggung tetap dipertahankan

Dari sepuluh run yang berhasil dipulihkan: 8.610 kandidat, 36 yang lolos gauntlet penuh (0,42%), 8 yang dipublikasikan. Jika hanya menghitung yang benar-benar masuk ke library, angka survivalnya adalah 0,09%.
Sebagai konteks, sebuah funnel validasi strategi publik yang dikenal luas — jenis analisis "kami menguji ribuan backtest" yang beredar di YouTube — meloloskan sekitar 5,7% kandidatnya. Tergantung apakah kamu membandingkan dengan gauntlet passers atau publikasi aktual Anny, funnel ini 8 hingga 60 kali lebih ketat. Bukan berarti Anny lebih pintar. Anny lebih selektif, dan itu berarti strategi yang memang membawa badge validasi Anny mendapatkannya dari filter yang tidak pernah dihadapi oleh kebanyakan pemasaran berbasis survivorship bias.
Dua temuan canggung di dalam funnel tersebut:
Hampir semuanya gugur di pintu masuk. 5.243 dari 5.370 kandidat dengan log terperinci — 97,6% — dieliminasi oleh dua gate paling dasar (terlalu sedikit trade, win rate di bawah ambang batas) sebelum mesin out-of-sample yang canggih sempat melihatnya. Salah satu gate out-of-sample Anny, hingga saat ini, belum pernah sekalipun aktif. Sebuah gauntlet di mana gate-gate canggihnya jarang digunakan adalah gauntlet yang bentuknya perlu dikerjakan ulang — dan menyeimbangkannya kembali adalah tepat apa yang dibahas di bagian berikutnya.
Tiga minggu data hilang. Run Anny pada 12, 19, dan 26 Juli hilang karena rotasi log sebelum sempat menyimpan hasil per-kandidat — untuk kandidat yang ditolak, tidak ada metrik yang disimpan di mana pun. Semua yang ada di atas direkonstruksi dari run yang berhasil dipulihkan, dan sejak itu Anny telah mengimplementasikan persistensi sehingga angka setiap kandidat di masa depan tersimpan baik yang lolos maupun tidak. Ketika Anny menyebut "rekonstruksi," perlakukan angka-angka tersebut persis seperti itu.
Pengakuan: Anny bahkan tidak menelusuri sepertiga dari peta

Ketika Anny mengagregasi survival berdasarkan keluarga strategi, dua keluarga — volume dan pattern — menunjukkan nol kandidat. Selamanya.
Itu bukan vonis pasar. Itu adalah bug: sebuah flag konfigurasi yang diperkenalkan selama penulisan ulang engine sebelumnya secara diam-diam membuang katalog strategi yang sudah diperluas, sehingga cron discovery mingguan terus menelusuri daftar hardcoded lama. Dua dari enam keluarga strategi tidak pernah masuk dalam perlombaan, dan tidak ada yang terdeteksi dalam pemantauan Anny. Anny menemukannya karena tabel survival keluarga membuat lubang tersebut tidak mungkin diabaikan — yang merupakan argumen yang cukup bagus untuk membangun tabelnya. Wiring-nya sudah diperbaiki; katalog yang diperluas menambahkan sekitar 7.000 backtest ke setiap run mingguan.
(Satu strategi dari keluarga pattern memang saat ini dipublikasikan. Strategi itu ditemukan pada 26 Juli — salah satu minggu yang log-nya hilang — sehingga Anny tidak dapat merekonstruksi funnel yang dilaluinya. Catatan itu tetap melekat padanya.)
Sisa tabel keluarga itu merendahkan dengan cara yang biasa: mixed confluence — keluarga "kombinasikan beberapa indikator" yang terdengar paling canggih — menghasilkan 0 dari 460. Momentum memiliki survival rate terbaik di 1,44%. Tidak ada yang melewati 2%.
Kemudian Anny mengarahkan gate baru ke dirinya sendiri
Pertanyaan yang lebih sulit: apakah strategi-strategi yang sudah diterbitkan Anny sendiri bertahan dari pengujian yang baru dibangun ini? Anny memutar ulang seluruh library 15 strategi melalui tiga gate baru. 10 dari 15 mendapat tanda peringatan.
- Walk-forward floor: 1 kegagalan. Satu strategi hanya mempertahankan 42,5% performanya pada data tak terlihat, di bawah ambang batas 50% — dan jauh di bawah yang terendah berikutnya di library pada 81,3%. Strategi itu ditandai untuk audit.
- Bootstrap: 6 ditandai. Empat memiliki drawdown 1-dari-20 reshuffled yang lebih buruk dari batas 35% (hingga 38,1%). Empat lainnya adalah masalah sebaliknya — lucky tails: satu strategi memiliki sejarah nyata yang lebih dangkal dari 98 dari 100 reshuffling-nya sendiri (persentil 1,9), artinya rekam jejak live-nya memperindah apa yang biasanya akan dihasilkan oleh trade yang sama. Dua strategi mengena kedua tanda peringatan.
- Divergence bound: 4 ditandai — semua strategi arah short yang skor data tak terlihatnya kira-kira dua kali lipat skor praktiknya (mis. 2,72 vs 1,24). Terlalu bagus juga merupakan tanda peringatan: jendela out-of-sample tersebut berada di kelemahan altcoin paruh pertama 2026, sehingga hadiah dari rezim pasar sedang melakukan pekerjaan yang tidak akan bisa diulang strategi itu atas permintaan sendiri.
Terutama, ketiga gate menangkap strategi yang berbeda — kegagalan walk-forward bersih dari sisi bootstrap, dan kegagalan bootstrap lolos walk-forward. Tidak ada satu pengujian pun yang akan menemukan semuanya.
Tidak ada yang dihapus secara diam-diam. Setiap tanda peringatan masuk ke audit manusia dengan bukti terlampir, dan pengguna yang menjalankan bot pada apapun yang akhirnya dihapus akan diberitahu langsung. Itu adalah kebijakan, bukan suasana hati.
Apa yang Anny pelajari dari reshuffles tentang losing streak
Saat menyeimbangkan kembali gate-gate, Anny menjalankan simulasi forward baru — 1.620 backtest di seluruh discovery universe — untuk menguji apakah gate win rate yang kasar bisa digantikan oleh bootstrap band. Dua temuan yang layak diperhatikan:
Bootstrap band adalah instrumen yang lebih tajam. Dari kandidat yang hanya diblokir oleh gate win rate, bootstrap band secara independen mematikan 8 dari 9 — dan ia juga gagalkan 5 dari 9 strategi yang lolos dari gauntlet penuh saat ini. Menerapkannya menyusutkan library sebelum apapun bertumbuh. Anny tetap melakukannya, diurutkan melalui audit, karena library yang kecil dan jujur lebih baik dari library yang besar tapi rapuh.
Losing streak adalah fitur dari matematika, bukan kerusakan. Di antara survivor dengan win rate 39,6–43,1%, maksimum losing streak adalah 6, 6, 6, 7, dan 11 kekalahan beruntun. Jika kamu menjalankan strategi dengan win rate ~40%, streak 6 hingga 11 kekalahan adalah pengalaman yang diharapkan. Angka itu akan ditampilkan Anny di samping strategi dengan win rate rendah, dan circuit breaker runtime (batas kerugian beruntun dan berbasis jendela waktu) aktif secara default untuk strategi-strategi tersebut — alternatif yang jujur daripada membiarkanmu menemukan streak itu dengan uang nyata.
Kejujuran cakupan: simulasi itu adalah satu jendela waktu, dua dari tiga timeframe, hanya daftar strategi lama. Jumlah utama yang dihasilkan memiliki ketidakpastian yang lebar; kesimpulan arahnya diperiksa terhadap funnel historis dan tetap berlaku.
Apa yang terjadi selanjutnya
- Audit. 10 strategi yang ditandai menjalani audit library bulanan Anny — keputusan manusia per strategi, bukti di atas meja, tidak ada penghapusan diam-diam. Jika sebuah strategi ditarik dari library, siapapun yang menjalankan bot di atasnya mendengarnya langsung dari Anny, sebelum mereka menyadarinya di antarmuka.
- Re-gauntlet bulanan. Replay library penuh kini menjadi bagian tetap dari audit tersebut. Badge yang diperoleh di bulan Juni harus diperoleh kembali di bulan Agustus; rezim pasar berubah dan validasi punya masa berlaku.
- Katalog yang lebih luas. Dengan konfigurasi yang tersembunyi sudah diperbaiki, strategi volume dan pattern akhirnya masuk dalam perlombaan — dan funnel serta grafik keluarga dalam artikel ini akan diregenerasi dari data yang sudah dipersistensikan, bukan direkonstruksi dari log.
Apa artinya ini bagimu
Ketika sebuah strategi di library Anny membawa badge validasi, artinya: ia bertahan dari funnel yang menolak lebih dari 99% kandidat, ia mempertahankan setidaknya setengah performanya pada data yang belum pernah dilihat, 500 sejarah alternatifnya tidak mengandung drawdown yang menghancurkan, dan hasilnya tidak terlalu buruk maupun terlalu bagus untuk dipercaya. Artinya juga badge itu bisa dicabut — oleh pengujian Anny sendiri, secara publik, sesuai jadwal.
Anny tidak bisa menjanjikan alpha. Tidak ada yang bisa secara jujur. Yang bisa Anny janjikan adalah bahwa semua yang diterbitkan telah diuji dengan mesin yang sama yang baru saja Anny gunakan pada dirinya sendiri — dan ketika mesin itu menemukan sesuatu yang memalukan, kamu akan membacanya di sini lebih dulu.
Semua angka dalam artikel ini berasal dari artefak run yang sudah di-commit dan replay job — tidak ada yang dirakit secara manual. Tiga run discovery Juli 2026 hilang karena rotasi log sebelum persistensi per-kandidat diterapkan; angka-angka untuk run yang berhasil dipulihkan direkonstruksi dari log run dan ditandai demikian di atas.
Ingin AI Anny menganalisis portofolio Anda? Coba Anny Line atau lihat harga.


