Prédiction de fraude de performance par machine learning des Centres de Santé de Base bénéficiaires du Financement Base sur la Performance
Rabearitsoa Florent Eric, Andry Ratovohery Andry, Randriatsarafara Fidiniaina Mamy, Rakotomalala Mamy Alain
Abstract
L’intelligence artificielle (IA) a considérablement transformé le secteur de la santé, pourtant son utilisation dans le contexte du Financement basé sur la performance (FBP) est très peu documentée. Cette étude vise à utiliser l’IA pour rendre plus efficient le mécanisme de vérification des données, pour détecter de fraudes des Centres de santé de base (CSB) du FBP.
Méthodologie : (1) Évaluer la performance (régression logistique, XGBoost), combinée à la gestion du déséquilibre de classes par (SMOTE, et ROSE). (2) Évaluer à l’aide des métriques clés (AUC, F2-Score, et coût attendu) les six pipelines de classification de fraude ainsi construits. Leurs performances moyenne sont évaluées par les tests de Friedman, de Nemenyi, et de DeLong, afin d’identifier le modèle de classification de fraudes des CSB le plus robuste, et performant. (3) Vérifier par le test du Chi-deux le lien entre l’anomalie des données, et la fraude.
Les résultats montrent que : le lien entre fraude, et anomalie des données est significatif. Et le modèle XGBoost est classé plus performant [accurancy (96%), balanced accuracy (91%), sensibilité (86%), spécificité (96%), F2-score (84%), l’AUC (95%), et Kappa de Cohen (78%)]. L’utilisation de l’IA permet de réduire à moins 25% le nombre de CSB à vérifier du FBP.
L’anomalie de données est un indice de suspicion de fraude, et le modèle XGBoost est classé performante et stable pour détecter les fraudes des CSB. Cette étude contribue à optimiser l’allocation des ressources publiques affectées au FBP par l’utilisation de l’IA.
Financement basé sur la performance, achat stratégique , régression logistique, XGBoost, économie de la santé
References
[1] I. Mathauer, E. Dale, M. Jowett, J. Kutzin. (2019). Purchasing health services for universal health coverage: how to make purchasing more strategic?,World Health Organization, WHO/UHC/HGF/PolicyBrief/19.6.2019.
[2] CORDAID-SINA, (2010). PBF in Action : Theories and Instruments, PBF Course Guide, The Hague. https://www.sina-health.com
[3] C. Achir, A.Douari. (2024). Le management du risque à l’ère de l’émergence de l’intelligence artificielle, Revue Française d’Économie et de Gestion, Vol.5: N°1, p.52–77.
[4] P. K. Kamuangu. (2024). (2024). A Review on Financial Fraud Detection using AI and Machine Learning, Journal of Economics, Finance and Accounting Studies, 6(1), 67-77.ISSN: 2709-0809.
[5] M. M. Breunig, H.-P. Kriegel, R. T. Ng, J. Sander. (2000). LOF : Identifying density-based local outliers, Proceedings of the 2000 ACM SIGMOD International Conference on Management of Data, p. 93–104. doi: 10.1145/342009.335388
[6] G. James, D. Witten, T. Hastie, and R. Tibshirani. (2013). An Introduction to Statistical Learning : with Applications in R, New York : Springer, p. 130–136, Chap. 4. ISBN : 978-1-4614-7137-0.
[7] I. Goodfellow, Y. Bengio, A. Courville. (2016). Deep Learning, Cambridge, MA: MIT Press, p. 190–192.
[8] T. Chen and C. Guestrin. (2016). XGBoost : A scalable tree boosting system, in Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16), San Francisco, CA, USA,, p. 785–794, . doi: 10.1145/2939672.2939785.
[9] A. M. Carrington, D. G. Manuel, P. W. Fieguth et al., “Deep ROC Analysis and AUC as Balanced Average Accuracy, for Improved Classifier Selection, Audit and Explanation,” IEEE Trans. Pattern Anal. Mach. Intell., vol. 45, no. 1, pp. 329–341, Jan. 2022, doi:10.1109
[10] T. Fawcett, (2006). An introduction to ROC analysis, Pattern Recognition Letters, 2006.
[11] K. H. Brodersen, C. S. Ong, K. E. Stephan and J. M. Buhmann. (2010). The balanced accuracy and its posterior distribution, in Proceedings of the 20th International Conference on Pattern Recognition (ICPR), Istanbul, Turkey, p.3121–3124.
[12] J. R. Landis and G. G. Koch. (1977). The measurement of observer agreement for categorical data, Biometrics, vol. 33, N°. 1, p. 159–174.
[13] H. He and E. A. Garcia. (2009). Learning from imbalanced data, IEEE Transactions on Knowledge and Data Engineering, Vol. 21, N°. 9, p. 1263–1284. doi: 10.1109/TKDE.2008.239.
[14] Y. Sasaki. (2007). The truth of the F-measure, Teach Tutor Materials, Vol. 1, N°. 5, p. 1–10.
[15] Institut National de la Statistique. (2024). Enquête Permanente auprès des Ménages (EPM) 2021–2022, Rapport INSTAT.