Hybrid Long-Term Fairness (HLTF) dalam Constrained Reinforcement Learning untuk pengambilan keputusan sekuensial pada distribusi zakat

Febryo Fibonacci, Amadeo (2026) Hybrid Long-Term Fairness (HLTF) dalam Constrained Reinforcement Learning untuk pengambilan keputusan sekuensial pada distribusi zakat. Sarjana thesis, UIN Sunan Gunung Djati Bandung.

[img]
Preview
Text
1_cover.pdf

Download (187kB) | Preview
[img]
Preview
Text
2_abstrak.pdf

Download (190kB) | Preview
[img]
Preview
Text
3_skbebasplagiarism.pdf

Download (1MB) | Preview
[img]
Preview
Text
4_daftarisi.pdf

Download (204kB) | Preview
[img]
Preview
Text
5_bab1.pdf

Download (386kB) | Preview
[img] Text
6_bab2.pdf
Restricted to Registered users only

Download (743kB) | Request a copy
[img] Text
7_bab3.pdf
Restricted to Registered users only

Download (997kB) | Request a copy
[img] Text
8_bab4.pdf
Restricted to Registered users only

Download (1MB) | Request a copy
[img] Text
9_bab5.pdf
Restricted to Registered users only

Download (314kB) | Request a copy
[img] Text
10_daftarpustaka.pdf
Restricted to Registered users only

Download (196kB) | Request a copy

Abstract

Distribusi zakat bersifat sekuensial dan menghadapi tantangan dalam mengoptimalkan kesejahteraan mustahik, menjaga keadilan jangka panjang, serta mematuhi aturan institusional secara simultan, sementara pendekatan yang ada belum mengintegrasikan ketiga aspek tersebut. Penelitian ini bertujuan merancang dan mengevaluasi pendekatan Hybrid Long-Term Fairness (HLTF) sebagai Constrained Markov Decision Process (CMDP) untuk kebijakan distribusi zakat. HLTF diselesaikan menggunakan algoritma PPO-Lagrangian yang mengintegrasikan Long-Term Benefit Rate (LBR) sebagai cost constraint eksplisit dan action projection untuk menjamin kepatuhan aturan institusional, dievaluasi pada lingkungan simulasi semi-sintetis berbasis data BAZNAS dan BPS Kota Bandung. Hasil menunjukkan HLTF mencapai reward rata-rata 0,086665 dengan violation rate 1,64%, turun 98,22% dibandingkan PPO Vanilla (91,80%). Pada evaluasi 250 episode test-split held-out, HLTF mempertahankan performa serupa dengan reward 0,086748 dan violation rate 6,95%, sementara pada skenario 2 (shock) yang belum pernah dilihat, generalisasi menurun violation rate 76,92%, menunjukkan arah pengembangan lanjutan.

Item Type: Thesis (Sarjana)
Uncontrolled Keywords: Distribusi Zakat; Reinforcement Learning; Constrained Markov Decision Process; Proximal Policy Optimization; Long-Term Fairness; Hybrid Long-Term Fairness.
Subjects: Data Processing, Computer Science > Computers Mathematical Principles
Data Processing, Computer Science > Computer Science Education
Divisions: Fakultas Sains dan Teknologi > Program Studi Teknik Informatika
Depositing User: Febryo Fibonacci Amadeo
Date Deposited: 13 Aug 2026 03:21
Last Modified: 13 Aug 2026 03:21
URI: https://digilib.uinsgd.ac.id/id/eprint/138091

Actions (login required)

View Item View Item