رگرسیون لجستیک باینری - یک آموزش

ساخت وبلاگ

در این آموزش ما در مورد رگرسیون لجستیک باینری و کاربرد آن در داده های زندگی واقعی می آموزیم. بدون شک ، رگرسیون لجستیک باینری همچنان پرکاربردترین روش مدل سازی پیش بینی کننده است.

می توانید پرونده های داده را برای این آموزش از اینجا بارگیری کنید.

اولا ، ما بحث خواهیم کرد که رگرسیون لجستیک باینری و کاربردهای آن در زمینه های مختلف چیست. سپس ما روی مدلهای آماری و آزمایش فرضیه تمرکز خواهیم کرد و در نهایت برای تقویت درک خود از یک مطالعه موردی در بانکداری استفاده خواهیم کرد.

رگرسیون لجستیک دودویی

رگرسیون لجستیک باینری رابطه بین مجموعه ای از متغیرهای مستقل و یک متغیر وابسته به دودویی است. این مفید است که متغیر وابسته از نظر طبیعت دوگانگی باشد ، مانند مرگ یا بقا ، عدم حضور یا حضور ، عبور یا شکست و غیره. متغیرهای مستقل می توانند طبقه بندی یا مداوم باشند ، به عنوان مثال ، جنسیت ، سن ، درآمد یا منطقه جغرافیایی. رگرسیون لجستیک باینری یک متغیر وابسته به عنوان یک ورود به سیستم P است ، که در آن P احتمال وجود دارد که متغیرهای وابسته مقدار 1 را بدست آورند.

Categorical dependent variable Categorical or continuous independent variables

حوزه های کاربرد

مدل های رگرسیون لجستیک باینری در بسیاری از حوزه ها و بخش ها استفاده می شود. این می تواند در تجزیه و تحلیل بازاریابی برای شناسایی خریداران بالقوه یک محصول یا در مدیریت منابع انسانی برای شناسایی کارمندانی که احتمالاً یک شرکت را ترک می کنند ، یا در مدیریت ریسک ، هدف پیش بینی پیش بینی کننده ها یا بیمه ای که هدف آن شناسایی می شود ، استفاده شود. پیش بینی خط مشی است. همه این اهداف مبتنی بر اطلاعاتی مانند سن ، جنس ، شغل ، مبلغ حق بیمه ، فرکانس خرید و غیره است و در تمام این اهداف ، متغیر وابسته باینری است ، در حالی که متغیرهای مستقل طبقه بندی یا مداوم هستند.

Applications of binary logistic regression

چرا از یک مدل رگرسیون خطی استفاده نمی کنیم؟

چرا نمی توانیم از رگرسیون خطی برای متغیرهای وابسته به باینری استفاده کنیم. یک دلیل این است که توزیع y تصادفی است و طبیعی نیست ، مانند مورد رگرسیون خطی. همچنین ، اگر از رگرسیون خطی برای یک متغیر وابسته به دودویی استفاده کنیم ، طرف های سمت چپ و راست مدل قابل مقایسه نخواهد بود.

Linear regression model

رگرسیون خطی برای پیش بینی یک مقدار پیوسته مانند پیش بینی قیمت ملک بر اساس مساحت در فوت مربع مناسب است. در چنین حالتی خط رگرسیون یک خط مستقیم است. از سوی دیگر رگرسیون لجستیک برای مسائل طبقه بندی استفاده می شود که احتمالی را پیش بینی می کنند که متغیر وابسته Y با توجه به مقادیر پیش بینی کننده ها مقدار «یک» را بگیرد. در رگرسیون لجستیک باینری، منحنی رگرسیون یک منحنی سیگموئید است.

Linear versus logistic regression

مدل آماری

این معادله یک مدل آماری برای رگرسیون لجستیک باینری با یک پیش بین واحد است. p کوچک احتمال این است که متغیر وابسته «Y» با توجه به مقدار «X»، که X متغیر مستقل است، مقدار یک را بگیرد. گزارش طبیعی "p تقسیم بر یک منهای p" را تابع logit یا پیوند می نامند. سمت راست تابع خطی X است که بسیار شبیه به مدل رگرسیون خطی است.

Binary logistic regression model

مدل آماری - برای k پیش بینی

مدل رگرسیون لجستیک عمومی برای یک پیش بینی کننده منفرد را می توان به مدلی با k پیش بینی کننده تعمیم داد و به صورتی که در اینجا نشان داده شده است. در این معادله، p احتمال این است که Y برابر با X داده شده باشد، که در آن Y متغیر وابسته و Xها متغیرهای مستقل هستند. B0 تا b K پارامترهای مدل هستند که با استفاده از روش حداکثر درستنمایی تخمین زده می شوند که به زودی در مورد آن صحبت خواهیم کرد. سمت چپ معادله بین منهای بی نهایت تا بعلاوه بی نهایت است.

Statistical model for k predicitors

p: احتمال اینکه Y=1 X را داده شود

Y: متغیر وابسته

مطالعه موردی - مدل سازی پیش فرض های وام

اجازه دهید اکنون به مفهوم رگرسیون لجستیک باینری با استفاده از مطالعه موردی بانکی نگاه کنیم. ما بانکی داریم که اطلاعات جمعیتی و معاملاتی مشتریان وام خود را در اختیار دارد. این بانک می خواهد مدلی ایجاد کند که پیش بینی نکول ها را داشته باشد و بتواند به بانک در تصمیم گیری برای پرداخت وام کمک کند. هدف در اینجا پیش بینی این است که آیا مشتریان متقاضی وام، نکول خواهند کرد یا خیر. ما از نمونه ای با اندازه 700 برای توسعه مدل استفاده می کنیم. متغیرهای مستقل گروه سنی، سال در آدرس فعلی، سال در کارفرمای فعلی، نسبت بدهی به درآمد، بدهی کارت اعتباری و سایر بدهی ها هستند. تمامی این متغیرها در زمان فرآیند درخواست وام جمع آوری شده و به عنوان متغیر مستقل استفاده خواهند شد. متغیر وابسته وضعیتی است که پس از پرداخت وام مشاهده می شود که در صورت عدم پرداخت وام یک و در غیر این صورت صفر خواهد بود.

Binary logistic regression banking case study

عکس فوری داده ها

در اینجا عکس فوری داده ها آورده شده است. متغیر وابسته ما باینری است ، در حالی که متغیرهای مستقل از نظر ماهیت طبقه بندی یا مداوم هستند.

Data Snapshot

تجزیه و تحلیل داده های اکتشافی

قبل از حرکت به مدل سازی ، انجام تجزیه و تحلیل اکتشافی همیشه مفید است. بگذارید مقداری تجزیه و تحلیل دو متغیره انجام دهیم. در جدول 1 رابطه بین وضعیت defaulter و گروه های سنی مختلف ارائه شده است. جدول 2 رفتار معامله ای را برای پیش بینی کننده ها و افراد غیرقانونی نشان می دهد. متوسط مسئولیت کارت اعتباری Defaulters 2. 42 در مقابل 1. 25 برای افراد غیرقانونی است. همچنین ، متوسط بدهی به درآمد برای پیش بینی کننده ها در مقایسه با افراد غیرقانونی بسیار زیاد است.

Default and age group relatioship

Transactional behaviour of defaulters and non-defaulters

مدل رگرسیون لجستیک باینری برای داده های وام بانکی

اینگونه است که مدل رگرسیون لجستیک باینری به دنبال مطالعه موردی ما خواهد بود. در اینجا ، P احتمال این است که مشتری یک defaulter باشد. پارامتر B رهگیری است و B1 B2 و غیره ضرایب سایر متغیرهای مستقل هستند. برای اهداف درک ، ما تمام متغیرهای مستقل را در مدل گنجانده ایم. با این حال ، مدل نهایی با استفاده از متغیرهای مستقل قابل توجه ارائه می شود.

Binary logistic regression for bank loan data

عملکرد احتمال

همانطور که قبلاً ذکر شد ، پارامترهای مدل رگرسیون لجستیک با استفاده از برآورد حداکثر احتمال تخمین زده می شود. عملکرد احتمال یک احتمال مشترک Y1 ، Y2… . up to yn است. پارامترها با به حداکثر رساندن عملکرد احتمال L. برآورد می شود. دو الگوریتم تکراری که معمولاً استفاده می شوند ، روش امتیاز دهی فیشر و روش نیوتن رافسون هستند. هر دو این الگوریتم ها برآورد پارامتر یکسان را با اختلاف اندکی در ماتریس کواریانس تخمین زده می کنند. از دیدگاه کاربردی ، ما نیازی به نگرانی در مورد ریاضیات پیچیده نداریم. این الگوریتم به عنوان یک تابع داخلی در R و Python در دسترس است.

maximum likelihood estimation

حداکثر برآورد احتمال پارامترها

جدول در اینجا تمام تخمین های پارامتر را نشان می دهد که می تواند برای نوشتن معادله مدل استفاده شود. معادله مدل می تواند برای تخمین احتمال پیش فرض با جایگزینی مقادیر ویژگی های خاص مشتری استفاده شود. توجه داشته باشید که سن یک متغیر طبقه بندی شده با 3 دسته است و از این رو دو مقدار ضریب برای دو متغیر ساختگی نشان داده شده است.

estimates of parameters variables

پارامترها ، احتمال و شانس

پیوند Logit یا عملکرد ورود به سیستم همچنین به عنوان ورود به سیستم شانس شناخته می شود ، جایی که احتمال موفقیت در تقسیم با احتمال شکست است. پارامتر تخمین زده شده تغییر در ورود به سیستم با توجه به تغییر واحد در متغیر مستقل را تغییر می دهد. به عنوان مثال ، ضریب تخمین زده شده از کار (یعنی تعداد سالهایی که مشتری در کارفرمای فعلی کار می کند) -0. 26172 است. این بدان معنی است که یک تغییر واحد در استخدام منجر به تغیی ر-0. 26712 در ورود به سیستم شانس خواهد شد. علامت منفی حاکی از آن است که مشتری با کار پایدار کمتر احتمال دارد که یک پیش فرض وام باشد. ما معمولاً نسبت شانس را به جای ضرایب رگرسیون برای یک مدل رگرسیون لجستیک تفسیر می کنیم. نسبت شانس اندازه گیری ارتباط بین متغیر وابسته و مستقل را نشان می دهد.

نسبت شانس چیست

بگذارید ببینیم نسبت شانس چیست. نسبت شانس اندازه گیری ارتباط بین متغیر مستقل و نتیجه است. نسبت شانس ، نسبت شانس این رویداد است که با توجه به x = 1 و x = 0 رخ می دهد. این نشان دهنده عاملی است که با استفاده از آن شانس تغییر یک واحد در متغیر مستقل تغییر می کند. با استفاده از مورچه ضریب رگرسیون می توانیم نسبت شانس را بدست آوریم.

Odds ratio calculation

نسبت شانس - مطالعه موردی

جدول نسبت شانس برای هر متغیر مستقل را نشان می دهد. نسبت شانس بیشتر از یک نشان دهنده ارتباط مثبت بین متغیرهای وابسته و مستقل است ، در حالی که نسبت شانس کمتر از یک رابطه منفی بین متغیرهای وابسته و مستقل را نشان می دهد. نسبت شانس برابر با یک نشان دهنده هیچ ارتباطی بین متغیرها نیست. به عنوان مثال ، نسبت شانس متغیر مستقل به کارآزمایی 0. 77 نشان می دهد که برای یک واحد تغییر در کار ، شانس بودن یک پیش فرض با 0. 77 برابر تغییر می کند یا 23 ٪ کاهش می یابد.

odds ratio case study

آزمایش فردی با استفاده از آزمون والد

برای شناسایی اینکه کدام متغیرهای مستقل از نظر آماری معنی دار هستند و در مدل نهایی گنجانده می شوند ، ما از آزمون والد استفاده می کنیم. این آزمون برای ارزیابی اهمیت هر متغیر مستقل به طور جداگانه استفاده می شود. فرضیه تهی برای آزمون والد "پارامتر خاص صفر است" است. همچنین این بدان معنی است که هیچ تاثیری از آن پیش بینی کننده در متغیر وابسته وجود ندارد. آمار آزمون داده شده توسط Z نسبت برآورد متغیر مستقل به خطای استاندارد تخمین متغیر مستقل است. طبق فرضیه تهی ، آمار آزمون فرض می شود که توزیع عادی استاندارد را دنبال می کند. اگر مقدار p کمتر از 0. 05 باشد ، فرضیه تهی را رد می کنیم.

Wald

Test statistic

بازپرداخت سریع

بگذارید سریع اقدام کنیم. در این جلسه ، ما در مورد مدل رگرسیون لجستیک باینری و کاربرد آن آشنا شدیم. ما همچنین در مورد چگونگی برآورد پارامترهای رگرسیون لجستیک باینری با استفاده از روش حداکثر احتمال و چگونگی تفسیر نسبت شانس بحث کردیم.

Binary logistic regression summary

این درس آموزش از دیپلم تحصیلات تکمیلی در علوم داده گرفته شده است.

برای کسب اطلاعات بیشتر می توانید دوره های ما را به صورت رایگان امتحان کنید

گزینه های باینری...
ما را در سایت گزینه های باینری دنبال می کنید

برچسب : نویسنده : هایده حائری بازدید : <-PostHit-> تاريخ : پنجشنبه 16 شهريور 1402 ساعت: 14:45