ناپارامتری
گاهی با دانستن توزیع داده ها به راحتی می توانیم برآورد گرها را بیابیم مثلا اگر داده های ما دارای توزیع نرمال باشند میانه و میانگین بر هم منطبقند پس در این حالت ما از آمار پارامتری استفاده می کنیم ...
در نقطه مقابل این کار وقتی ما توزیع احتمال داده هایمان را نداریم برای برآورد میانه از آمار ناپارامتری استفاده می کنیم ....
چیزهایی که در آمار ناپارامتری باید بدانیم:
الف:
یک نمونه ی تصادفی از Xi ها (شرط نمونه ی تصادفی بودن مستقل و هم توزیع بودن است) حال مقدار عددی Xi ها را به طور غیر نزولی مرتب می کنیم و دنباله ی حاصل شده را با Yr نشان می دهیم( واضح است که Yr ها دارای توزیعهای متفاوت و نا مستقل هستند) به راحتی می توان نشان داد که این آماره ی ترتیبی در حقیقت یک آماره است( تابعی از نمونه تصادفی است)
نامگذاری: به بزرگترین و کوچکترین آماره ی دنباله Yr آماره نهایی یا فرین گفته می شود که از آن می توان در مطالعاتی مثل مطالعات زمین شناسی استفاده کرد.
ب:
برای تولید یک نمونه تصادفی که دارای توزیع پیوسته(G(x باشد (که دارای وارون G -1 است)
1- از روی جدول اعداد تصادفی از توزیع U(0 ,1 ) ، U iها را تولید می کنیم
2- حل معادله(u i= G(x i ( در این صورت xi = G -1 (u i را به دست می آوریم
به این ترتیب x iها حاصل می شوند که به این کار شبیه سازی می گویند.
شبیه سازی در حالت گسسته:
عدد تصادفی u را که بین(1و0) است انتخاب می کنیم اگر u بین صفر و p1 باشد (pi احتمال وقوع x iها هستند) x1 تولید می شود و اگر u بین p1 وp 1 + p 2 باشد x 2 و الی آخر.
پ:
آزمون نشانه:
می خواهیم فرض صفر(Q p=a (Q pچندک مرتبه ی p است را آزمون کنیم برای این کار وقتی p=0.5 است داریم:
1- اعدادی را که برابر a هستند حذف می کنیم
2- به جای اعدادی که بزرگتر از a هستند علامت + می گذاریم
3- به جای اعدادی که کوچکتر از a هستند علامت - می گذاریم
فرض صفر زمانی قبول می شود که تعداد مثبت ها زیاد باشد(پنجاه درصد داده ها مقاومتشان برابر a است) ولی با توجه به اینکه نمی دانیم مثبت ها چقدر باید زیاد باشند از p – مقدار استفاده می کنیم.
ت:
مثلا اگر در ارزیابی کنکور رتبه ها بین (100000و1) قرار گیرند، دانشگاهی داوطلبانی را قبول می کند که رتبه شان بین (3000و1) است حال این پرسش پیش می آید که اگر ما داوطلبی را به طور تصادفی انتخاب کنیم آیا این داوطلب (3000و1) را پوشش می دهد؟ یعنی رتبه ی داوطلب در این محدوده قرار دارد یا نه؟پس پوشش A نسبتی از داوطلبان است که برای آن ها رتبه در این مجموعه قرار می گیرد.
به کمک پوششها و فرمولهای مربوط به آن به راحتی می توان چندک های متفاوت را به دست آورد.
ج:
فاصله ی تحمل در واقع احتمال یک احتمال است به این معنا که با چه احتمالی مساحتی را که برای فاصله اطمینان به دست آوردیم از کل مساحت را اشکال میکند که این احتمال برای n های کوچکتر از 25 از جدول توزیع دو جمله ای و برای n های بزرگ به کمک تقریب نرمال به دست آورد که مقدار حاصل یک عدد است.
به راحتی و با استفاده از فرمولهای مناسب می توان به طور مثال کوچکترین مقدار را برای n طوری تعیین کنیم که با a درصد اطمینان حاصل شود که طول عمر دست کم b درصد از فراورده ها در فاصله اطمینان (y1 , y n ) قرار بگیرد
ز:
داده ها را به ترتیب غیر نزولی مرتب می کنیم و به ترتیب از چپ به راست به آن ها رتبه های 1 تا n را می دهیم ( نظیر کاری که در کنکور انجام می دهند) اگر رتبه ها را با R iنشان دهیم واضح است که R iتابعی از نمونه ی تصادفی می باشد.
آماره های رتبه ای:
X1,…,X nیک نمونه تصادفی از توزیع پیوسته(F(x است و(R=(R1 ,….R n بردار رتبه ها است هر تابعی از R مانند(V(R را یک آماره رتبه ای می گویند.
ط:
دو نمونه ی تصادفی X 1 , …, X m و Y 1 , …, Y n را با شرایط زیر داریم:
X دارای توزیع(F(xاست. Y دارای توزیع(G(y است.(G(Y)=F(y-c و R iرتبه ی X i و S j رتبه ی Y j باشد W R را که جمع R i ها و W s را که جمع S j ها باشد راآماره جمعی رتبه ای ویلکاکسون می نامند.
برای تعیین اینکه یک سیستم آموزشی کارآمد است یا نه یک گروه 7 نفره از دانشجویان را انتخاب می کنیم و به سه نفر از آنها X 1, X 2 , X 3 با سیستم جدید آموزش می دهیم گروه چهار نفره ی مابقی را Y 1 ,Y 2, Y 3 ,Y4 می نامیم برای آزمون H 0 یعنی بی اثر بودن سیستم آموزشی مراحل زیر را انجام می دهیم:
نمرات 7 دانشجو را به ترتیب غیر نزولی مرتب می کنیم و رتبه های X 1, X 2 , X 3 را با S1 , S 2, S 3 مشخص می کنیم جمع این سه رتبه W s را تشکیل حال اگر W s خیلی بزرگ باشد باید فرض صفر را رد کرد.
ک:
در آزمون ویلکاکسون قبل تمام دو تاییهای (X i, Y i) را در نظر می گیریم حال تعریف زیر را داریم:
شماره (X i, Y i) ها با فرض اینکه Xi کوچکتر از Y I باشد = W XY
شماره (X i, Y i) ها با فرض اینکه Xi بزرگتر از Y I باشد = W YX
دو آماره W YX و W XY را آماره های من ویتنی می گویند.
به حالت بسیار ساده تر W YX یا W XY را از فرمولهایی که به راحتی اثبات می شود از روی W s می توان به دست آورد.
H 0زمانی رد می شود که W XY بسیار بزرگ باشد.
در تمامی این موارد برای اینکه نمی دانیم W XY چقدر باید بزرگ باشد به حالت ساده تر از P- مقدار استفاده می کنیم.
برآورد پارامتر c (اثر روش نو)
می دانیم که در آمار ناپارامتری در تعیین اینکه آیا روش نو بهتر است یا نه از رتبه استفاده می کنیم.در واقع وقتی روش نو بهتر است که رتبه اش بزرگتر باشد حال اگر بخواهیم که این مزیت را برآورد کنیم از روش زیر استفاده می کنیم: ( c تفاضل میانگین y از میانگین x است)
1- X i,ها و Y iها را در یک جدول (تواما) قرار می دهیم
2- تفاضل تک تک X i,ها با Y iها را به دست می آوریم
3- تفاضلها را به ترتیب صعودی مرتب می کنیم
4- میانه و میانگین تفاضلها را به دست می آوریم
مشاهده می شود که میانه و میانگین تفاوت چندانی با هم ندارند ولی از آمار ریاضی به خاطر داریم که میانگین واریانس کمتری دارد و براورد کننده ی بهتری است
هر گاه F نرمال باشد آزمون تی از آزمون ویلکاکسون پر توان تر است.
رتبه گذاری یافته های گره دار:
هرگاه تعدادی یافته ی برابر داشته باشیم می توانیم به هریک از آن ها رتبه ای برابر با معدل رتبه هایی که در دنباله دارند بدهیم.
ل:
آزمون رتبه ای – نشانه ای ویلکاکسون : در این آزمون علاوه بر نشانه Z iها رتبه ی قدر مطلق آنها نیز استفاده می شود.
Z1 , … , Z n نمونه ی تصادفی مورد نظر است و(U i= I ( Z i در نظر می گیریم جمع U U i R i )R I رتبه Z I ها است) را W قرار می دهیم اگر W خیلی بزرگ شود فرض صفر رد می شود.
م:
برای بیان نحوه ی ارتباط دو متغیر از همبستگی استفاده می شود و برای سنجش این همبستگی از ضریب همبستگی استفاده می کنیم:
ضریب همبستگی ساده (پیرسن):
هر دو متغیر پیوسته و نرمال باشند
ضریب همبستگی رتبه ای اسپیرمن:
در فرمول ضریب همبستگی ساده تمام عبارت ها را به رتبه تبدیل می کنیم و برای غیر نرمال و گسسته هم کاربرد دارد.
ضریب همبستگی کندال:
از رتبه ها و تفاضل داده ها استفاده می کند و برخلاف ضریب همبستگی ساده برای متغیر های غیر نرمال و گسسته هم کاربرد دارد.
ن:
از آزمون دوها برای تعیین اینکه داده ها تصادفی هستند یا نه و همچنین تعیین مساوی بودن دو توزیع استفاده می شود.
فرض کنید داده هایی را به تصادف انتخاب می کنیم و روی یک خط می چینیم در این مثال قرار داد می کنیم که داده هایی را که کمتر از میانه هستند x و بقیه را y بنامیم بصورت زیر:
yyyy x y x y xx yyy آن دسته از x ها و y هایی را که پشت سر هم آمده اند یک دو می نامیم در مثال بالا 7 دو داریم که 4 تا از نوع y و 3 تا از نوع x است.
ی:
آزمون برازندگی توزیع مانند خرید لباس است . در خرید شما لباسی را انتخاب می کنید که کاملا اندازه ی شما باشد( مناسب ترین لباس را با توجه به شرایط مختلف انتخاب می کنید)
در آمار نیز ما سعی می کنیم با توجه به شرایط مختلف یک متغیر تصادفی بهترین توزیع را انتخاب کنیم حال اینکه چقدر این توزیع برای متغیر مناسب است یا نه را با توجه به آزمون برازندگی توزیع می توان پاسخ داد.
داده پردازان فروزش که کادر آن متشکل از کارشناسان ارشد آمار و اعضای انجمن آمار ایران می باشد مفتخر به ارایه خدماتی چون :