Febryo Fibonacci, Amadeo (2026) Hybrid Long-Term Fairness (HLTF) dalam Constrained Reinforcement Learning untuk pengambilan keputusan sekuensial pada distribusi zakat. Sarjana thesis, UIN Sunan Gunung Djati Bandung.
|
Text
1_cover.pdf Download (187kB) | Preview |
|
|
Text
2_abstrak.pdf Download (190kB) | Preview |
|
|
Text
3_skbebasplagiarism.pdf Download (1MB) | Preview |
|
|
Text
4_daftarisi.pdf Download (204kB) | Preview |
|
|
Text
5_bab1.pdf Download (386kB) | Preview |
|
|
Text
6_bab2.pdf Restricted to Registered users only Download (743kB) | Request a copy |
||
|
Text
7_bab3.pdf Restricted to Registered users only Download (997kB) | Request a copy |
||
|
Text
8_bab4.pdf Restricted to Registered users only Download (1MB) | Request a copy |
||
|
Text
9_bab5.pdf Restricted to Registered users only Download (314kB) | Request a copy |
||
|
Text
10_daftarpustaka.pdf Restricted to Registered users only Download (196kB) | Request a copy |
Abstract
Distribusi zakat bersifat sekuensial dan menghadapi tantangan dalam mengoptimalkan kesejahteraan mustahik, menjaga keadilan jangka panjang, serta mematuhi aturan institusional secara simultan, sementara pendekatan yang ada belum mengintegrasikan ketiga aspek tersebut. Penelitian ini bertujuan merancang dan mengevaluasi pendekatan Hybrid Long-Term Fairness (HLTF) sebagai Constrained Markov Decision Process (CMDP) untuk kebijakan distribusi zakat. HLTF diselesaikan menggunakan algoritma PPO-Lagrangian yang mengintegrasikan Long-Term Benefit Rate (LBR) sebagai cost constraint eksplisit dan action projection untuk menjamin kepatuhan aturan institusional, dievaluasi pada lingkungan simulasi semi-sintetis berbasis data BAZNAS dan BPS Kota Bandung. Hasil menunjukkan HLTF mencapai reward rata-rata 0,086665 dengan violation rate 1,64%, turun 98,22% dibandingkan PPO Vanilla (91,80%). Pada evaluasi 250 episode test-split held-out, HLTF mempertahankan performa serupa dengan reward 0,086748 dan violation rate 6,95%, sementara pada skenario 2 (shock) yang belum pernah dilihat, generalisasi menurun violation rate 76,92%, menunjukkan arah pengembangan lanjutan.
| Item Type: | Thesis (Sarjana) |
|---|---|
| Uncontrolled Keywords: | Distribusi Zakat; Reinforcement Learning; Constrained Markov Decision Process; Proximal Policy Optimization; Long-Term Fairness; Hybrid Long-Term Fairness. |
| Subjects: | Data Processing, Computer Science > Computers Mathematical Principles Data Processing, Computer Science > Computer Science Education |
| Divisions: | Fakultas Sains dan Teknologi > Program Studi Teknik Informatika |
| Depositing User: | Febryo Fibonacci Amadeo |
| Date Deposited: | 13 Aug 2026 03:21 |
| Last Modified: | 13 Aug 2026 03:21 |
| URI: | https://digilib.uinsgd.ac.id/id/eprint/138091 |
Actions (login required)
![]() |
View Item |



