Predicting Life Insurance Policyholder Churn in Iran Using Machine Learning: A Transparent and Actionable Framework (مقاله علمی وزارت علوم)
درجه علمی: نشریه علمی (وزارت علوم)
آرشیو
چکیده
This study tackles the challenge of customer churn in life insurance, which leads to substantial financial losses. It introduces a transparent, reproducible, and leakage-free machine learning framework designed to identify at-risk policyholders accurately and efficiently. Using 20,000 anonymized Iranian life insurance policies with a churn rate of 26%, the study develops a complete modeling pipeline that includes imputation, standardization, and encoding steps performed strictly within the training process to prevent data leakage. Three model types, logistic regression, random forest, and XGBoost, were trained and evaluated using stratified cross-validation, F1-optimized thresholds, and performance metrics such as ROC-AUC, F1, and precision. Results show that all models perform similarly (ROC-AUC ≈ 0.70), with logistic regression achieving the highest F1 score (0.66) and XGBoost offering the best precision (0.68). The top-ranked predictions captured about 69% of churners, demonstrating strong operational potential. Policyholders with major payment delays were identified as the most churn-prone and easily detectable group. Overall, the findings confirm that transparent and interpretable machine learning models can effectively balance accuracy, simplicity, and practicality, supporting data-driven, value-focused customer retention strategies in the life insurance industryپیش بینی ریزش بیمه گذاران بیمه عمر در ایران با استفاده از یادگیری ماشین: چارچوبی شفاف و عملیاتی
این پژوهش به بررسی چالش ریزش مشتری در بیمه های عمر می پردازد، چالشی که منجر به زیان های مالی قابل توجهی می شود. در این مطالعه، یک چارچوب یادگیری ماشین شفاف، قابل بازتولید و بدون نشت داده معرفی شده است که برای شناسایی دقیق و کارآمد بیمه گذاران در معرض خطر طراحی شده است. با استفاده از ۲۰٬۰۰۰ پرونده بیمه عمر ایرانی ناشناس با نرخ ترک ۲۶٪، این مطالعه یک پایپ لاین کامل مدل سازی توسعه داده است که شامل مراحل جای گذاری مقادیر گمشده (imputation)، استانداردسازی و کدگذاری است؛ این مراحل به صورت کامل در فرآیند آموزش انجام شده اند تا از نشت داده جلوگیری شود. سه نوع مدل (رگرسیون لجستیک، جنگل تصادفی (Random Forest) و XGBoost) با استفاده از اعتبارسنجی متقاطع لایه بندی شده، آستانه های بهینه شده بر اساس F1 و معیارهای ارزیابی از جمله ROC-AUC، F1 و دقت (precision) آموزش داده و ارزیابی شدند. نتایج نشان می دهد که عملکرد همه مدل ها مشابه است (ROC-AUC 0.70)؛ در حالی که رگرسیون لجستیک بالاترین امتیاز F1 (0.66) و XGBoost بهترین دقت (0.68) را کسب کرده است. پیش بینی های با رتبه ی بالا حدود ۶۹٪ از مشتریان ترک کننده را شناسایی کردند که نشان دهنده ی پتانسیل عملیاتی قوی این روش است. بیمه گذاران دارای تأخیرهای عمده در پرداخت، به عنوان گروهی که بیشترین احتمال ترک را دارند و به راحتی قابل شناسایی هستند، مشخص شدند. در مجموع، یافته ها تأیید می کنند که مدل های یادگیری ماشین شفاف و قابل تفسیر می توانند میان دقت، سادگی و کاربردپذیری توازن مؤثری برقرار کنند , و از راهبردهای نگهداشت مشتری مبتنی بر داده و ارزش محور در صنعت بیمه عمر پشتیبانی نمایند.





