در این آموزش ما در مورد رگرسیون لجستیک باینری و کاربرد آن در داده های زندگی واقعی می آموزیم. بدون شک ، رگرسیون لجستیک باینری همچنان پرکاربردترین روش مدل سازی پیش بینی کننده است.
می توانید پرونده های داده را برای این آموزش از اینجا بارگیری کنید.
اولا ، ما بحث خواهیم کرد که رگرسیون لجستیک باینری و کاربردهای آن در زمینه های مختلف چیست. سپس ما روی مدلهای آماری و آزمایش فرضیه تمرکز خواهیم کرد و در نهایت برای تقویت درک خود از یک مطالعه موردی در بانکداری استفاده خواهیم کرد.
رگرسیون لجستیک دودویی
رگرسیون لجستیک باینری رابطه بین مجموعه ای از متغیرهای مستقل و یک متغیر وابسته به دودویی است. این مفید است که متغیر وابسته از نظر طبیعت دوگانگی باشد ، مانند مرگ یا بقا ، عدم حضور یا حضور ، عبور یا شکست و غیره. متغیرهای مستقل می توانند طبقه بندی یا مداوم باشند ، به عنوان مثال ، جنسیت ، سن ، درآمد یا منطقه جغرافیایی. رگرسیون لجستیک باینری یک متغیر وابسته به عنوان یک ورود به سیستم P است ، که در آن P احتمال وجود دارد که متغیرهای وابسته مقدار 1 را بدست آورند.
حوزه های کاربرد
مدل های رگرسیون لجستیک باینری در بسیاری از حوزه ها و بخش ها استفاده می شود. این می تواند در تجزیه و تحلیل بازاریابی برای شناسایی خریداران بالقوه یک محصول یا در مدیریت منابع انسانی برای شناسایی کارمندانی که احتمالاً یک شرکت را ترک می کنند ، یا در مدیریت ریسک ، هدف پیش بینی پیش بینی کننده ها یا بیمه ای که هدف آن شناسایی می شود ، استفاده شود. پیش بینی خط مشی است. همه این اهداف مبتنی بر اطلاعاتی مانند سن ، جنس ، شغل ، مبلغ حق بیمه ، فرکانس خرید و غیره است و در تمام این اهداف ، متغیر وابسته باینری است ، در حالی که متغیرهای مستقل طبقه بندی یا مداوم هستند.
چرا از یک مدل رگرسیون خطی استفاده نمی کنیم؟
چرا نمی توانیم از رگرسیون خطی برای متغیرهای وابسته به باینری استفاده کنیم. یک دلیل این است که توزیع y تصادفی است و طبیعی نیست ، مانند مورد رگرسیون خطی. همچنین ، اگر از رگرسیون خطی برای یک متغیر وابسته به دودویی استفاده کنیم ، طرف های سمت چپ و راست مدل قابل مقایسه نخواهد بود.
رگرسیون خطی برای پیش بینی یک مقدار پیوسته مانند پیش بینی قیمت ملک بر اساس مساحت در فوت مربع مناسب است. در چنین حالتی خط رگرسیون یک خط مستقیم است. از سوی دیگر رگرسیون لجستیک برای مسائل طبقه بندی استفاده می شود که احتمالی را پیش بینی می کنند که متغیر وابسته Y با توجه به مقادیر پیش بینی کننده ها مقدار «یک» را بگیرد. در رگرسیون لجستیک باینری، منحنی رگرسیون یک منحنی سیگموئید است.
مدل آماری
این معادله یک مدل آماری برای رگرسیون لجستیک باینری با یک پیش بین واحد است. p کوچک احتمال این است که متغیر وابسته «Y» با توجه به مقدار «X»، که X متغیر مستقل است، مقدار یک را بگیرد. گزارش طبیعی "p تقسیم بر یک منهای p" را تابع logit یا پیوند می نامند. سمت راست تابع خطی X است که بسیار شبیه به مدل رگرسیون خطی است.
مدل آماری - برای k پیش بینی
مدل رگرسیون لجستیک عمومی برای یک پیش بینی کننده منفرد را می توان به مدلی با k پیش بینی کننده تعمیم داد و به صورتی که در اینجا نشان داده شده است. در این معادله، p احتمال این است که Y برابر با X داده شده باشد، که در آن Y متغیر وابسته و Xها متغیرهای مستقل هستند. B0 تا b K پارامترهای مدل هستند که با استفاده از روش حداکثر درستنمایی تخمین زده می شوند که به زودی در مورد آن صحبت خواهیم کرد. سمت چپ معادله بین منهای بی نهایت تا بعلاوه بی نهایت است.
p: احتمال اینکه Y=1 X را داده شود
Y: متغیر وابسته
مطالعه موردی - مدل سازی پیش فرض های وام
اجازه دهید اکنون به مفهوم رگرسیون لجستیک باینری با استفاده از مطالعه موردی بانکی نگاه کنیم. ما بانکی داریم که اطلاعات جمعیتی و معاملاتی مشتریان وام خود را در اختیار دارد. این بانک می خواهد مدلی ایجاد کند که پیش بینی نکول ها را داشته باشد و بتواند به بانک در تصمیم گیری برای پرداخت وام کمک کند. هدف در اینجا پیش بینی این است که آیا مشتریان متقاضی وام، نکول خواهند کرد یا خیر. ما از نمونه ای با اندازه 700 برای توسعه مدل استفاده می کنیم. متغیرهای مستقل گروه سنی، سال در آدرس فعلی، سال در کارفرمای فعلی، نسبت بدهی به درآمد، بدهی کارت اعتباری و سایر بدهی ها هستند. تمامی این متغیرها در زمان فرآیند درخواست وام جمع آوری شده و به عنوان متغیر مستقل استفاده خواهند شد. متغیر وابسته وضعیتی است که پس از پرداخت وام مشاهده می شود که در صورت عدم پرداخت وام یک و در غیر این صورت صفر خواهد بود.
عکس فوری داده ها
در اینجا عکس فوری داده ها آورده شده است. متغیر وابسته ما باینری است ، در حالی که متغیرهای مستقل از نظر ماهیت طبقه بندی یا مداوم هستند.
تجزیه و تحلیل داده های اکتشافی
قبل از حرکت به مدل سازی ، انجام تجزیه و تحلیل اکتشافی همیشه مفید است. بگذارید مقداری تجزیه و تحلیل دو متغیره انجام دهیم. در جدول 1 رابطه بین وضعیت defaulter و گروه های سنی مختلف ارائه شده است. جدول 2 رفتار معامله ای را برای پیش بینی کننده ها و افراد غیرقانونی نشان می دهد. متوسط مسئولیت کارت اعتباری Defaulters 2. 42 در مقابل 1. 25 برای افراد غیرقانونی است. همچنین ، متوسط بدهی به درآمد برای پیش بینی کننده ها در مقایسه با افراد غیرقانونی بسیار زیاد است.
مدل رگرسیون لجستیک باینری برای داده های وام بانکی
اینگونه است که مدل رگرسیون لجستیک باینری به دنبال مطالعه موردی ما خواهد بود. در اینجا ، P احتمال این است که مشتری یک defaulter باشد. پارامتر B رهگیری است و B1 B2 و غیره ضرایب سایر متغیرهای مستقل هستند. برای اهداف درک ، ما تمام متغیرهای مستقل را در مدل گنجانده ایم. با این حال ، مدل نهایی با استفاده از متغیرهای مستقل قابل توجه ارائه می شود.
عملکرد احتمال
همانطور که قبلاً ذکر شد ، پارامترهای مدل رگرسیون لجستیک با استفاده از برآورد حداکثر احتمال تخمین زده می شود. عملکرد احتمال یک احتمال مشترک Y1 ، Y2… . up to yn است. پارامترها با به حداکثر رساندن عملکرد احتمال L. برآورد می شود. دو الگوریتم تکراری که معمولاً استفاده می شوند ، روش امتیاز دهی فیشر و روش نیوتن رافسون هستند. هر دو این الگوریتم ها برآورد پارامتر یکسان را با اختلاف اندکی در ماتریس کواریانس تخمین زده می کنند. از دیدگاه کاربردی ، ما نیازی به نگرانی در مورد ریاضیات پیچیده نداریم. این الگوریتم به عنوان یک تابع داخلی در R و Python در دسترس است.
حداکثر برآورد احتمال پارامترها
جدول در اینجا تمام تخمین های پارامتر را نشان می دهد که می تواند برای نوشتن معادله مدل استفاده شود. معادله مدل می تواند برای تخمین احتمال پیش فرض با جایگزینی مقادیر ویژگی های خاص مشتری استفاده شود. توجه داشته باشید که سن یک متغیر طبقه بندی شده با 3 دسته است و از این رو دو مقدار ضریب برای دو متغیر ساختگی نشان داده شده است.
پارامترها ، احتمال و شانس
پیوند Logit یا عملکرد ورود به سیستم همچنین به عنوان ورود به سیستم شانس شناخته می شود ، جایی که احتمال موفقیت در تقسیم با احتمال شکست است. پارامتر تخمین زده شده تغییر در ورود به سیستم با توجه به تغییر واحد در متغیر مستقل را تغییر می دهد. به عنوان مثال ، ضریب تخمین زده شده از کار (یعنی تعداد سالهایی که مشتری در کارفرمای فعلی کار می کند) -0. 26172 است. این بدان معنی است که یک تغییر واحد در استخدام منجر به تغیی ر-0. 26712 در ورود به سیستم شانس خواهد شد. علامت منفی حاکی از آن است که مشتری با کار پایدار کمتر احتمال دارد که یک پیش فرض وام باشد. ما معمولاً نسبت شانس را به جای ضرایب رگرسیون برای یک مدل رگرسیون لجستیک تفسیر می کنیم. نسبت شانس اندازه گیری ارتباط بین متغیر وابسته و مستقل را نشان می دهد.
نسبت شانس چیست
بگذارید ببینیم نسبت شانس چیست. نسبت شانس اندازه گیری ارتباط بین متغیر مستقل و نتیجه است. نسبت شانس ، نسبت شانس این رویداد است که با توجه به x = 1 و x = 0 رخ می دهد. این نشان دهنده عاملی است که با استفاده از آن شانس تغییر یک واحد در متغیر مستقل تغییر می کند. با استفاده از مورچه ضریب رگرسیون می توانیم نسبت شانس را بدست آوریم.
نسبت شانس - مطالعه موردی
جدول نسبت شانس برای هر متغیر مستقل را نشان می دهد. نسبت شانس بیشتر از یک نشان دهنده ارتباط مثبت بین متغیرهای وابسته و مستقل است ، در حالی که نسبت شانس کمتر از یک رابطه منفی بین متغیرهای وابسته و مستقل را نشان می دهد. نسبت شانس برابر با یک نشان دهنده هیچ ارتباطی بین متغیرها نیست. به عنوان مثال ، نسبت شانس متغیر مستقل به کارآزمایی 0. 77 نشان می دهد که برای یک واحد تغییر در کار ، شانس بودن یک پیش فرض با 0. 77 برابر تغییر می کند یا 23 ٪ کاهش می یابد.
آزمایش فردی با استفاده از آزمون والد
برای شناسایی اینکه کدام متغیرهای مستقل از نظر آماری معنی دار هستند و در مدل نهایی گنجانده می شوند ، ما از آزمون والد استفاده می کنیم. این آزمون برای ارزیابی اهمیت هر متغیر مستقل به طور جداگانه استفاده می شود. فرضیه تهی برای آزمون والد "پارامتر خاص صفر است" است. همچنین این بدان معنی است که هیچ تاثیری از آن پیش بینی کننده در متغیر وابسته وجود ندارد. آمار آزمون داده شده توسط Z نسبت برآورد متغیر مستقل به خطای استاندارد تخمین متغیر مستقل است. طبق فرضیه تهی ، آمار آزمون فرض می شود که توزیع عادی استاندارد را دنبال می کند. اگر مقدار p کمتر از 0. 05 باشد ، فرضیه تهی را رد می کنیم.
بازپرداخت سریع
بگذارید سریع اقدام کنیم. در این جلسه ، ما در مورد مدل رگرسیون لجستیک باینری و کاربرد آن آشنا شدیم. ما همچنین در مورد چگونگی برآورد پارامترهای رگرسیون لجستیک باینری با استفاده از روش حداکثر احتمال و چگونگی تفسیر نسبت شانس بحث کردیم.
این درس آموزش از دیپلم تحصیلات تکمیلی در علوم داده گرفته شده است.
برای کسب اطلاعات بیشتر می توانید دوره های ما را به صورت رایگان امتحان کنید