sklearn. tree . DecisionTreeregressor¶

ساخت وبلاگ

کلاس sklea. tree. 0. 0) [منبع]

رگرر درخت تصمیم.

در راهنمای کاربر بیشتر بخوانید.

عملکرد برای اندازه گیری کیفیت تقسیم. معیارهای پشتیبانی شده "squared_error" برای میانگین خطای مربع است ، که برابر با کاهش واریانس به عنوان معیار انتخاب ویژگی است و با استفاده از میانگین هر گره ترمینال ، "friedman_mse" ، از دست دادن L2 به حداقل می رسد ، که از میانگین خطای مربع با نمره بهبود فریدمن برای بالقوه استفاده می کند. تقسیمات ، "Absolute_error" برای میانگین خطای مطلق ، که با استفاده از میانه هر گره ترمینال ، از دست دادن L1 به حداقل می رسد و "پواسون" که از کاهش در انحراف پواسون برای یافتن شکاف استفاده می کند.

جدید در نسخه 0. 18: معیار میانگین خطای مطلق (MAE).

جدید در نسخه 0. 24: معیار انحراف پواسون.

تقسیم کننده ، پیش فرض = "بهترین"

استراتژی مورد استفاده برای انتخاب تقسیم در هر گره. استراتژی های پشتیبانی شده "بهترین" برای انتخاب بهترین تقسیم و "تصادفی" برای انتخاب بهترین تقسیم تصادفی هستند.

max_depth int ، پیش فرض = هیچ

حداکثر عمق درخت. اگر هیچ کدام ، گره ها تا زمانی که تمام برگها خالص نباشند یا تا زمانی که تمام برگها حاوی نمونه های min_samples_split باشند ، گسترش می یابند.

min_samples_split int یا float ، پیش فرض = 2

حداقل تعداد نمونه های مورد نیاز برای تقسیم یک گره داخلی:

  • اگر int ، min_samples_split را به عنوان حداقل تعداد در نظر بگیرید.
  • اگر شناور باشد ، سپس min_samples_split کسری است و سقف (min_samples_split * n_samples) حداقل تعداد نمونه ها برای هر تقسیم است.

در نسخه 0. 18 تغییر یافته است: مقادیر شناور اضافه شده برای کسری.

min_samples_leaf int یا float ، پیش فرض = 1

حداقل تعداد نمونه های مورد نیاز در یک گره برگ است. یک نقطه تقسیم در هر عمق فقط در صورتی در نظر گرفته می شود که حداقل نمونه های آموزش min_samples_leaf در هر یک از شاخه های چپ و راست را ترک کند. این ممکن است تأثیر صاف کردن مدل ، به ویژه در رگرسیون داشته باشد.

  • اگر int ، min_samples_leaf را به عنوان حداقل تعداد در نظر بگیرید.
  • اگر شناور باشد ، سپس min_samples_leaf کسری است و مایع (min_samples_leaf * n_samples) حداقل تعداد نمونه ها برای هر گره است.

در نسخه 0. 18 تغییر یافته است: مقادیر شناور اضافه شده برای کسری.

min_weight_fraction_leaf float ، پیش فرض = 0. 0

حداقل کسر وزنی از مجموع کل وزن ها (از تمام نمونه های ورودی) مورد نیاز در یک گره برگ است. نمونه ها در صورت عدم ارائه نمونه_ وزن ، دارای وزن برابر هستند.

max_features int ، float یا ، پیش فرض = هیچ

تعداد ویژگی هایی که باید هنگام جستجوی بهترین تقسیم در نظر بگیرید:

  • در صورت Int ، ویژگی های MAX_FEATURES را در هر تقسیم در نظر بگیرید.
  • در صورت شناور ، سپس max_features کسری و حداکثر (1 ، int (max_features * n_features_in_)) در هر تقسیم در نظر گرفته می شود.
  • اگر "خودکار" ، سپس max_features = n_features.
  • اگر "sqrt" ، سپس max_features = sqrt (n_features).
  • اگر "log2" ، سپس max_features = log2 (n_features).
  • اگر هیچ کدام ، سپس max_features = n_features.

از نسخه 1. 1 کاهش یافته است: گزینه "خودکار" در 1. 1 کاهش یافته و در 1. 3 حذف می شود.

توجه: جستجوی تقسیم تا حداقل یک پارتیشن معتبر از نمونه های گره متوقف نمی شود ، حتی اگر نیاز به بازرسی مؤثر بیش از ویژگی های MAX_FEATURES داشته باشد.

Random_state int ، نمونه تصادفی یا هیچ کدام ، پیش فرض = هیچ

max_leaf_nodes int ، پیش فرض = هیچ

یک درخت را با max_leaf_nodes با بهترین شکل اول پرورش دهید. بهترین گره ها به عنوان کاهش نسبی در ناخالصی تعریف می شوند. اگر هیچکدام ، تعداد نامحدود گره های برگ.

min_impurany_decrease float ، پیش فرض = 0. 0

اگر این تقسیم باعث کاهش ناخالصی بیشتر از یا مساوی با این مقدار شود ، یک گره تقسیم می شود.

معادله کاهش ناخالصی وزنی به شرح زیر است:

N_T / N * (ناحانی - n_t_r / N_T * امنیت راست_ - n_t_l / N_T * Left_IMPURITY) 

در جایی که n تعداد کل نمونه ها است ، N_T تعداد نمونه ها در گره فعلی است ، N_T_L تعداد نمونه های کودک چپ است و N_T_R تعداد نمونه های کودک سمت راست است.

در صورت تصویب نمونه_ وزن ، n ، n_t ، n_t_r و n_t_l همه به مبلغ وزنی مراجعه می کنند.

جدید در نسخه 0. 19.

شناور غیر منفی CCP_ALPHA ، پیش فرض = 0. 0

پارامتر پیچیدگی مورد استفاده برای حداقل هرس هزینه و انعطاف پذیری. زیر درخت با بزرگترین پیچیدگی هزینه که کوچکتر از CCP_ALPHA است انتخاب می شود. به طور پیش فرض ، هیچ گونه هرس انجام نمی شود. برای جزئیات بیشتر هرس کمپانی هزینه را ببینید.

جدید در نسخه 0. 22.

ویژگی ها: ویژگی های_یمورس_ ndarray از شکل (n_features ،)

واردات ویژگی را برگردانید.

max_features_ int

مقدار استنباط شده max_features.

n_features_in_ int

تعداد ویژگی های دیده شده در هنگام تناسب.

جدید در نسخه 0. 24.

feature_names_in_ ndarray از شکل (n_features_in_ ،)

نام ویژگی های دیده شده در هنگام تناسب. فقط زمانی تعریف می شود که X دارای نام های ویژگی است که همه رشته ها هستند.

جدید در نسخه 1. 0.

n_outputs_ int

تعداد خروجی ها هنگام انجام تناسب.

نمونه درخت_ درخت

شیء درخت زیرین. لطفاً برای ویژگی های شیء درخت و درک ساختار درخت تصمیم گیری برای استفاده اساسی از این ویژگی ها ، به Help (sklea. tree. _tree. tree) مراجعه کنید.

طبقه بندی کننده درخت تصمیم.

مقادیر پیش فرض برای پارامترهای کنترل اندازه درختان (به عنوان مثال max_depth ، min_samples_leaf و غیره) منجر به درختان کاملاً رشد یافته و غیرمجاز می شود که به طور بالقوه می توانند در برخی از مجموعه داده ها بسیار بزرگ باشند. برای کاهش مصرف حافظه ، پیچیدگی و اندازه درختان باید با تنظیم آن مقادیر پارامتر کنترل شود.

L. Breiman ، J. Friedman ، R. Olshen ، and C. Stone ، "طبقه بندی و درختان رگرسیون" ، Wadsworth ، Belmont ، CA ، 1984.

T. Hastie ، R. Tibshirani و J. Friedman."عناصر یادگیری آماری" ، اسپرینگر ، 2009.

>>> از جانب sklea. datasets وارد كردن load_diabetes >>> از جانب sklea. model_selection وارد كردن cross_val_score >>> از جانب sklea. tree وارد كردن تصمیم >>> X, y = load_diabetes(Retu_x_y=درست است، واقعی) >>> رگ = تصمیم(state تصادفی=0) >>> cross_val_score(رگ, X, y, cv=10) . . آرایه ([ -0. 39. -0. 46. 0. 02. 0. 06. -0. 50. 0. 16. 0. 11.-0. 73.-0. 30.-0. 00.]]) 

شاخص برگ را که هر نمونه به عنوان پیش بینی شده است برگردانید.

مسیر هرس را در طول هرس حداقل هزینه و انعطاف پذیری محاسبه کنید.

مسیر تصمیم گیری را در درخت برگردانید.

متناسب (x ، y [، sample_weight ، check_input])

یک رگرسیون درخت تصمیم را از مجموعه آموزش (X ، Y) بسازید.

عمق درخت تصمیم را برگردانید.

تعداد برگهای درخت تصمیم را برگردانید.

پارامترهایی را برای این برآوردگر دریافت کنید.

پیش بینی کلاس یا رگرسیون برای X.

امتیاز (x ، y [، sample_weight])

ضریب تعیین پیش بینی را برگردانید.

پارامترهای این برآوردگر را تنظیم کنید.

شاخص برگ را که هر نمونه به عنوان پیش بینی شده است برگردانید.

جدید در نسخه 0. 17.

پارامترها: x از شکل (n_samples ، n_features)

نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.

چک_بوته BOOL ، پیش فرض = درست است

اجازه دهید چندین بررسی ورودی را دور بزنید. از این پارامتر استفاده نکنید مگر اینکه بدانید چه کاری انجام می دهید.

بازگشت: x_leaves مانند شکل شکل (n_samples ،)

برای هر DataPoint X در x ، شاخص برگ x را به پایان برسانید. برگها در [0) شماره گذاری می شوند. self. tree_. node_count) ، احتمالاً با شکاف در شماره گذاری.

cost_complexity_pruning_path (x ، y ، sample_weight = هیچ) [منبع]

مسیر هرس را در طول هرس حداقل هزینه و انعطاف پذیری محاسبه کنید.

برای جزئیات بیشتر در مورد فرآیند هرس، هرس کم هزینه-پیچیدگی را ببینید.

پارامترها: x از شکل (n_samples ، n_features)

نمونه های ورودی آموزشدر داخل، به dtype=np. float32 تبدیل می شود و اگر یک ماتریس پراکنده به یک csc_matrix پراکنده ارائه شود.

y آرایه مانند شکل (n_samples،) یا (n_samples، n_outputs)

مقادیر هدف (برچسب های کلاس) به صورت اعداد صحیح یا رشته ها.

نمونه_وزن آرایه مانند شکل (n_samples،)، پیش فرض=هیچکدام

وزن نمونهاگر هیچ، نمونه ها به یک اندازه وزن می شوند. تقسیم هایی که می توانند گره های فرزند با وزن صفر خالص یا منفی ایجاد کنند، هنگام جستجو برای تقسیم در هر گره نادیده گرفته می شوند. اگر منجر به حامل وزن منفی هر کلاس در هر گره فرزند شود، تقسیم ها نادیده گرفته می شوند.

برمی گرداند: ccp_path Bunch

شی دیکشنری مانند، با ویژگی های زیر.

آلفاهای موثر زیردرخت در هنگام هرس.

مجموع ناخالصی های برگ فرعی برای مقدار آلفای مربوطه در ccp_alphas.

تصمیم_مسیر (X, check_input = True) [منبع] ¶

مسیر تصمیم گیری را در درخت برگردانید.

جدید در نسخه 0. 18.

پارامترها: x از شکل (n_samples ، n_features)

نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.

چک_بوته BOOL ، پیش فرض = درست است

اجازه دهید چندین بررسی ورودی را دور بزنید. از این پارامتر استفاده نکنید مگر اینکه بدانید چه کاری انجام می دهید.

برمی گرداند: ماتریس شکل پراکنده نشانگر (n_samps، n_nodes)

یک ماتریس CSR نشانگر گره را برگردانید که در آن عناصر غیر صفر نشان می دهد که نمونه ها از گره ها عبور می کنند.

واردات ویژگی را برگردانید.

اهمیت یک ویژگی به عنوان کاهش کل (نرمال شده) معیار ارائه شده توسط آن ویژگی محاسبه می شود. همچنین به عنوان اهمیت جینی شناخته می شود.

اخطار: اهمیت ویژگی های مبتنی بر ناخالصی می تواند برای ویژگی های اصلی (بسیاری از مقادیر منحصر به فرد) گمراه کننده باشد. به عنوان جایگزین به sklea. inspection. permutation_importance مراجعه کنید.

برمی گرداند: feature_importances_ ndarray شکل (n_features,)

کاهش کلی معیارها بر اساس ویژگی (اهمیت جینی).

مناسب (X، y، sample_weight = هیچ، check_input = True) [منبع] ¶

یک رگرسیون درخت تصمیم را از مجموعه آموزش (X ، Y) بسازید.

پارامترها: x از شکل (n_samples ، n_features)

نمونه های ورودی آموزشدر داخل، به dtype=np. float32 تبدیل می شود و اگر یک ماتریس پراکنده به یک csc_matrix پراکنده ارائه شود.

y آرایه مانند شکل (n_samples،) یا (n_samples، n_outputs)

مقادیر هدف (اعداد واقعی). برای حداکثر کارآیی از dtype = np. float64 و سفارش = 'c' استفاده کنید.

نمونه_وزن آرایه مانند شکل (n_samples،)، پیش فرض=هیچکدام

وزن نمونه. اگر هیچ کدام ، نمونه ها به همان اندازه وزن دارند. شکاف هایی که گره های کودک را با صفر خالص یا وزن منفی ایجاد می کنند ، هنگام جستجوی شکاف در هر گره ، نادیده گرفته می شوند.

چک_بوته BOOL ، پیش فرض = درست است

اجازه دهید چندین بررسی ورودی را دور بزنید. از این پارامتر استفاده نکنید مگر اینکه بدانید چه کاری انجام می دهید.

بازده: خود تصمیم تصمیم گیری

عمق درخت تصمیم را برگردانید.

عمق درخت حداکثر فاصله بین ریشه و هر برگ است.

بازگشت: self. tree_. max_depth int

حداکثر عمق درخت.

تعداد برگهای درخت تصمیم را برگردانید.

بازگشت: self. tree_. n_leaves int

تعداد برگها

پارامترهایی را برای این برآوردگر دریافت کنید.

پارامترها: بول عمیق ، پیش فرض = درست است

در صورت صحت ، پارامترهای این برآوردگر و حاوی زیربناهای حاوی برآوردگر را برمی گرداند.

بازگشت: پارامترها دیکته

نام پارامترها به مقادیر آنها نقشه برداری شده است.

پیش بینی کلاس یا رگرسیون برای X.

برای یک مدل طبقه بندی ، کلاس پیش بینی شده برای هر نمونه در x بازگردانده می شود. برای یک مدل رگرسیون ، مقدار پیش بینی شده بر اساس x بازگردانده می شود.

پارامترها: x از شکل (n_samples ، n_features)

نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.

چک_بوته BOOL ، پیش فرض = درست است

اجازه دهید چندین بررسی ورودی را دور بزنید. از این پارامتر استفاده نکنید مگر اینکه بدانید چه کاری انجام می دهید.

بازگشت: y شکل مانند شکل (n_samples) ، یا (n_samples ، n_outputs)

کلاسهای پیش بینی شده یا مقادیر پیش بینی.

ضریب تعیین پیش بینی را برگردانید.

ضریب تعیین (r^2 ) به عنوان ((1 - frac) ) تعریف شده است ، جایی که (u ) جمع باقیمانده مربع ها ((y_true - y_pred) ** 2) . sum () و (v ) مجموع مربع ها ((y_true - y_true. mean ()) ** 2) . sum () است. بهترین نمره ممکن 1. 0 است و می تواند منفی باشد (زیرا مدل می تواند به طور خودسرانه بدتر باشد). یک مدل ثابت که همیشه مقدار مورد انتظار Y را پیش بینی می کند ، با توجه به ویژگی های ورودی ، نمره (R^2 ) 0. 0 را بدست می آورد.

پارامترها: X شکل شکل (N_Samples ، n_features)

نمونه های آزمایشبرای برخی از برآوردگرها این ممکن است یک ماتریس هسته پیش ساخته یا لیستی از اشیاء عمومی به جای آن با شکل (n_samples ، n_samples_fitted) باشد ، جایی که n_samples_fitted تعداد نمونه های مورد استفاده در اتصالات برای برآوردگر است.

y آرایه مانند شکل (n_samples،) یا (n_samples، n_outputs)

مقادیر واقعی برای x.

نمونه_وزن آرایه مانند شکل (n_samples،)، پیش فرض=هیچکدام

بازگشت: نمره شناور

(r^2 ) از self. predict (x) W. R. T. y

نمره (r^2 ) هنگام فراخوانی نمره در یک رگرسیون از MultiOutput = 'unioford_avenal' از نسخه 0. 23 استفاده می شود تا با مقدار پیش فرض R2_Score سازگار باشد. این بر روش نمره همه رگرسیونرهای چند منظوره (به جز MultioutPutregressor) تأثیر می گذارد.

پارامترهای این برآوردگر را تنظیم کنید.

این روش بر روی برآوردگرهای ساده و همچنین روی اشیاء تو در تو کار می کند (مانند خط لوله). دومی پارامترهای فرم __ را دارد تا بتوانید هر مؤلفه یک شیء تو در تو را به روز کنید.

پارامترها: ** پارامترها

بازده: نمونه خود برآوردگر

گزینه های باینری...
ما را در سایت گزینه های باینری دنبال می کنید

برچسب : نویسنده : هایده حائری بازدید : <-PostHit-> تاريخ : چهارشنبه 15 شهريور 1402 ساعت: 12:35