nedeľa 23. septembra 2012

Normálne rozdelenie - 2. diel

 
Praktické využitie normálneho rozdelenia vyžaduje poznatok viacrozmerného modelu. Ak by sme mali riešiť chyby  objemu náplne alkoholu do fliaš, je logické, že potrebujeme brať v úvahu nielen čas plnenia, ale aj tlak trysky a iné náhodné faktory.
Otázka viac rozmernosti rozdelenia náhodných veličín je na mieste aj u iných rozdelení, nie len u normálneho. Avšak my si neskôr ukážeme, že niektoré rozdelenia (nie je ich málo) sa za splnenia istých podmienok nahradzujú normálnym!
To je jeden z hlavných dôvodov, prečo chcem normálne rozdelenie rozpísať do viacerých dielov!
Začnime teda modelom viacrozmerného rozdelenia, ktorý je podobný modelu jednorozmerného. Povedzme, že sa budeme hrať s vektormi stredných hodnôt, konkrétnych hodnôt veličín a nezaobídeme sa bez kovariančnej matice a jej determinantu.
1) Vektor hodnôt náhodných veličín a stredných hodnôt náhodných veličín (s-rozmerný vektor)
image
2) Kovariančná matica:
image
Ktorá má na diagonále rozptyly jednotlivých veličín a mimo diagonálu kovariančné koeficienty. Z toho vyplýva, že bude pozitívne definitná. Jej determinant označíme takto:

image
Takto pripravené hodnoty použijeme v nasledujúcom rozdelení:
image
My si ukážeme, ako zostrojiť takúto funkciu povedzme pre tri náhodné imageveličiny. Na začiatok si prosím stiahnite sample file a môžeme začať.
V liste INPUT máme k dispozícii v čase usporiadané hodnoty náhodných veličín.  Tieto veličiny môžu byť napríklad tlak, konzistencia tekutiny, čas procesu a iné. My potrebujeme definovať vzťahy medzi týmito veličinami.
Začneme charakteristikou polohy, ktorú definujeme priemerom, použijeme nasledujúcu funkciu:
=AVERAGE(Oblasť hodnôt náhodnej veličiny)
Ďalej potrebujeme určiť rozptyl jednotlivých veličín:
=VARA(Oblasť hodnôt náhodnej veličiny)
Stretávame sa tu s pojmom kovariančný koeficient, tento pojem bližšie budem opisovať pri regresnej analýze, nám bude pre túto časť stačiť vzorec:
=COVARIANCE.S(Oblasť hodnôt náhodnej veličiny A;Oblasť hodnôt náhodnej veličiny B)
Takto vytvorené údaje môžeme zoskupiť do vektora stredných hodnôt a kovariančnej matice a nesmieme zabudnúť na determinant matice:
=MDETERM(Oblasť matice)
Výsledok môže vyzerať taktoimage:
Teraz nám stačí nadefinovať rozumnú škálu konkrétnych hodnôt náhodných veličín (viď list OUTPUT). Z nich vytvoríme diferencie so strednými hodnotami a vypočítame separátne pravdepodobnosti:
=(1/((POWER(2*PI();1,5)*SQRT(INPUT!$F$28))))*EXP(1)^(-0,5*MMULT(MMULT(D2:F2;INPUT!$F$23:$H$25);TRANSPOSE(D2:F2)))
POZNÁMKA: pri súčine matíc je veľmi dôležité poznať metodiku počtu riadkov/stĺpcov. Taktiež ak násobíte matice, vektory alebo kombináciu matíc a vektorov, MUSÍTE použiť kombináciu klávesníc Ctrl + Shift + Enter. V opačnom prípade sa vám vyskytne chyba typu: #VALUE!
Výsledné pravdepodobnosti pre konkrétne hodnoty veličín X1, X2 a X3 sa dajú prakticky považovať za nulové. Dôvod? Uvažujeme spojité rozdelenie, t.z. že každá jednotlivá izolovaná hodnota(y) ako výsledok pokusu prakticky neprichádza v úvahu (nedokážete naliať do nádrže presne 1,00000… liter benzínu). Avšak, ak sčítame tieto skoro nulové pravdepodobnosti pre jednotlivé hodnoty a tento súčet budeme uvažovať ako pravdepodobnosť, že výsledok pokusu sa bude nachádzať v našom intervale, vtedy táto práca má zmysel!
Spojité rozdelenie má zmysel využívať pri analýze pravdepodobností, že sa výsledok bude nachádzať v intervale!
Nabudúce sa budeme zaoberať kovariančným a korelačným koeficientom ako vsuvkou pre praktickú ukážku 2-rozmerného normálneho rozdelenia.

Normálne rozdelenie - 1.diel

 
Toto, štatisticky významné rozdelenie je tak dôležité, že sa mu budem venovať vo viacerých dieloch.
Už pri popise charakteristík náhodných veličín som ho spomenul v súvislosti so špicatosťou a šikmosťou. Ak si nájdete pojmy ako regresná analýza, alebo chcete modelovať úrokové miery, ceny finančných derivátov apod., všade sa stretnete so základom (axióm) normálne alebo log-normálne rozdelenej veličiny, ktorú mienite analyzovať.
Otázka splnenia normálnosti veličiny je už odlišná kapitola, ktorá sa rieši individuálnymi testami tzv. normality, poprípade sa používajú sofistikovanejšie modely s použitím napríklad Študentovho rozdelenia.
Jednorozmerné normálne rozdelenie vyzerá takto:
image
V Excel-i (viď sample file) si ho môžeme vygenerovať nasledovne:
1) Nadefinujte strednú hodnotu µ a smerodajnú odchýlku δ
2) zvoľte si interval hodnôt X, so stredom rovným µ a rozpätím rovným aspoň
3) Vedľa v novom stĺpci použijeme funkciu norm.dist:
=NORM.DIST(hodnota X;Priemer - stredná hodnota; Smerodajná odchýlka;1-Kumulovaná distr. a 0- pravdepodobnostná funkcia)
Výsledok si môžete zobraziť do grafu napríklad takto:
image
Modro sfarbená funkcia je pravdepodobnostné rozdelenie (symetrické okolo strednej hodnoty) a bordová je distribučná funkcia, ktorá evidentne konverguje k hodnote 1. Závislosť “ostrosti” pravdepodobnostnej funkcie a tiež uhol rastu distribučnej funkcie spravidla závisí na veľkosti rozptylu (smerodajnej odchýlky).
Platí: čím menší rozptyl, tým je rozdelenie náhodnej veličiny presnejšie, kopec je strmší a spád distribučnej funkcie väčší.
image











Pokračujme definíciou momentovej vytvárajúcej funkcie. Najprv pre náhodnú veličinu X a potom z nej odvodíme momentovú funkciu pre normovanú Y:
image















 
 
 
 
 
 
 






image



























Prečo sme vlastne použili normovanú veličinu Y? Lebo uvažovaná veličina X má normované normálne rozdelenie s nulovou strednou hodnotou a rozptylom rovným 1.
Ak chceme z normálne rozdelenej veličiny utvoriť normovanú normálne rozdelenú veličinu, použijeme:
image
Tento vzťah je veľmi užitočný, bez ktorého sa ťažko riešia problémy v praxi. Takže ho doporučujem ovládať Úsmev.  V rámci článku by bolo vhodné uviesť charakteristiky rozdelenia, tie však nebudem odvodzovať, nakoľko sa jedná o ten istý princíp ako v predchádzajúcich rozdeleniach, takže:
image
To by bolo pre dnešok všetko. Vyzerá to byť náročnejšie na mozgové bunky, no pri riešení praktických problémov sa relatívne často používa štatistika, teda človek potrebuje definovať to, ako sa správa pravdepodobnosť (definovať rozdelenie) a na základe charakteru pravdepodobnosti môže predpovedať a rozhodovať. O to lepšie sa ľuďom manipuluje s dátami a problematikou, ak dokážu posúdiť ktoré rozdelenie je vhodné a ktoré nie!
Nemusíte si pamätať vzorčeky, stačí ak sa na ne pozriete a viete podstatu! Prakticky stačí, ak poznáte momentovú funkciu, z ktorej dokážete nadefinovať čokoľvek!

Poissonovo rozdelenie a neočakávané deti

Kto si z vás pamätá na Taylorov rozvoj alebo Maclaurinov? Našou úlohou nebude venovať sa týmto pojmom, no dnes musím poukázať na ich dôležitosť a to nie len pri Poissonovom rozdelení, ale celkovo pri akýchkoľvek iných problematikách.
Nám bude postačovať fakt, že:
image
Čo musíme urobiť aby sa daný výraz rovnal 1? Predelíme ho eλ. Dôvod? Predsa súčet pravdepodobností výskytu všetkých možných náhodných javov musí byť rovný 1. Tým pádom, môžeme pravdepodobnosť veličiny {x} vyjadriť takto:
image
Pokračujme momentovou vytvárajúcou funkciou, z ktorej odvodíme strednú hodnotu a rozptyl (parciálna derivácia podľa Z a potom dosadenie Z=0):
image




image




Použitie rozdelenia
Už samotný názov článku naznačuje, že použijem príklad zo života, príklad ktorý v učebniciach nenájdete.  Predstavme si, že vyrábame prezervatívy. Celkom triviálna vec, čo na tom bude vyrobiť kus poväčšine latexovej čiapočky na jedno použitie. No podstata a náklady nespočívajú v samotnom výrobnom procese, ale taktiež v testovaní a vývoji komfortnejších typov.
Existujú rôzne typy testov bezpečnosti kondómov, no všeobecne sa delia na dve skupiny:
Deštruktívne testy – techniky, ktoré testujú výberové vzorky kondómov až pokiaľ sa nezničia, pritom vyhodnocujú rôzne parametre.
Nedeštruktívny test – kondóm ako izolácia pri elektrickom prúde.
Budeme uvažovať nedeštruktívnu metódu testu a povedzme, že podľa štandardov 99,9% vyrobených kondómov musí úspešne absolvovať túto kontrolu pred tým, než si ich kúpite. Naša prevádzka je zatiaľ malá, s kapacitou 10000 kondómov denne. To znamená, že môžeme denne odhadnúť v priemere 10 zle izolovaných kondómov. Ak ich zaznamenáme viac, musíme výrobu pozastaviť a analyzovať výrobný proces spolu s materiálom individuálne.
Naša výroba eviduje v priemere 7 zlých izolantov (kondómov), To znamená, že naše λ=7. Takto si pomocou Excel-u môžeme zostaviť rozdelenie pomocou pravdepodobnostnej a distribučnej funkcie takto:
=POISSON.DIST(počet očakávaných chýb ; priemerný počet chýb ; 0 – separovaná pravdepodobnosť, 1 – kumulovaná pravdepodobnosť)
Výsledok si samozrejme môžete stiahnuť. image





Graficky môžeme toto rozdelenie interpretovať takto:image

Rozdelenie síce na obrázku vyzerá symetricky, obecne tento fakt neplatí pre každé λ. Avšak platí, že čím je λ väčšie, tým je rozdelenie menej šikmé, teda symetrickejšie.
Pokúsme sa sa vrátiť k testu kondómov a analyzujme, s akou pravdepodobnosťou budeme musieť prerušiť výrobu a vykonávať hĺbkovú kontrolu?
Odpoveď:
Hodnoty z nášho testu nesmú byť väčšie ako 10! Pozrime sa na kumulovanú pravdepodobnosť pre hodnotu 10. Potom túto hodnotu odčítame od 1 a máme výsledok:imageJe vidieť, že s pravdepodobnosťou 0,09852 môžeme celkom predpovedať, že naša denná produkcia kondómov nemusí byť dostatočne bezpečná.
Poučenie:
Nejde o to s kým, kde a za akých okolností, ale o to že aj za tak triviálnou antikoncepciou akou sú kondómy stojí fakt, že tie testy nezaručujú 100% bezpečnosť produktu. Takto som sa snažil priblížiť, že aj tak na prvý pohľad  triviálne rozdelenie môže (a ono aj v praxi skutočne má) veľké využitie a existencia firiem v mnohých prípadoch visí na viac-menej na podobnom štatistickom vlásku. Avšak nechcem tým garantovať, že presne takto sa vyhodnocuje kvalita prezervatívov Smiech, no hypoteticky to môže byť podobné – povedzme o niečo zložitejšie! Takže prosím nezľaknite sa a ak sa vám “stane nehoda”, tak pamätajte že nič nie je dokonalé.
Budúcim článkom by sme mali prejsť k spojitým rozdeleniam, takže máte sa na čo tešiť.

Binomické rozdelenie – prehľad

 
Po dlhšej dobe sa opäť vraciam k písaniu a budem pokračovať v binomickom rozdelení. Z hľadiska znalosti jednotlivých vzorčekov je veľmi jednoduché, stačí ak sa pozrieme na povedzme vývoj  rozdelenia. V podstate môžeme konštatovať, že Binomické rozdelenie je zovšeobecnený model Alternatívneho rozdelenia.

Alternatívne rozdelenie

Jedného krásneho dňa sedíte napríklad v električke a ani sa nenazdáte a prisadne si k vám nádherné dievča. Keďže ste vo veľkomeste, prakticky nemáte šancu ju ešte niekedy stretnúť a preto viete, že ak s ňou chcete ísť von, musíte ju presvedčiť práve v ten nie príliš všedný okamih Úsmev
Vezmime v úvahu niekoľko faktorov: výzor, úsmev, charizma, komunikačné schopnosti (niektorí chlapci-lovci môžu zobrať v úvahu aj relatívnu úspešnosť všetkých svojich pokusov) a stanovme si šancu, že ju “zbalíme”. Pre ilustráciu, kamarát Adam bude optimistický a verí si, že to zvládne na 70%. Čo môže nastať?

1) pozitívny jav, slečnu presvedčil dohodol napr. večeru
2) negatívny jav, slečna mu slušným spôsobom naznačila, že nemá záujem
Definujeme náhodnú veličinu  {x}, v ktorej úspech označíme číslom 1 a neúspech 0 (nula-jednotkový typ) a vypočítame si pravdepodobnosť úspechu takto:
image
V našom prípade bude pravdepodobnosť, že Adam bude skórovať vyzerať takto:
image
Analogicky to bude vyzerať pre neúspech (dievča ho odmietne s pravdepodobnosťou 0,3). Takýto pohľad na problematiku sa možno zdá tak trocha zbytočný, ale berieme v úvahu štatisticky najjednoduchší prípad (aj keď zoznámiť sa za takýchto okolností nemusí byť jednoduché).
Prejdime k momentovej vytvárajúcej funkcii:
image












Tým pádom môžeme parciálnou deriváciou podľa Z a dosadením Z=0 do zderivovanej funkcie dostať jednotlivé momenty takto:


image

Opustíme jednoduché alternatívne rozdelenie, uvažujme fakt, že Adam zlyhal. Čo sa môže diať po tom?

1) Takéto prípady zbytočne nedramatizuje, berie život optimisticky a verí, že ta pravá ho niekde čaká
2) Zdôverí sa mi s tým a čaká povzbudenie

Uvažujeme druhý prípad a mňa nenapadne nič rozumnejšie ako štatistický pohľad na vec Úsmev. Adam proste musí pochopiť, že uvažovať v takýchto prípadoch Alternatívnym rozdelením jednoducho nestačí! 
Musí si uvedomiť, že je síce pravda, že každá žena je istým spôsobom výnimočná, no existuje isté konečné množstvo prvkov alebo čŕt, ktoré vzhľadom k jeho povahe potrebuje jeho budúca polovička spĺňať. Preto musí uvažovať zovšeobecnene, Binomickým rozdelením!

Uznáme, že tá žena v električke síce bola sympatická, no podobný typ (vzhľadom ku konečnému počtu spoločných a pre Adama dôležitých čŕt) môže stretnúť povedzme 5 krát za mesiac (často sa pohybuje medzi ľuďmi). 

Tým pádom sa ho opýtam: aká je pravdepodobnosť, že z 5 žien aspoň jedna z nich pôjde povedzme na večeru?

V takom prípade bude Adamovi jedno, ktoré dievča z piatich si s nim vyrazí von. Prakticky sa mu otvoril nový pohľad na vec: výzor-zjav, ktorý ho upúta nie je všetko! Tá nemenej dôležitá povahová zložka je náhodná (nedokážeme pohľadom definovať povahu).  Vráťme sa k položenej otázke a ukážeme si odpoveď:
Obecný vzorec:
image

Alebo Alternatívne rozdelenie v ktorom sme nahradili jednu slečnu viacerými, teda n a pridali sme kombinačný člen (je nám prakticky jedno, ktorá z n slečien pôjde von).
Riešenie: potrebujeme si vyjadriť pravdepodobnosť, že ani jedna z žien s ním nepôjde von a potom odčítať od 1. Výraz aspoň jedna znamená prvá, druhá, tretia, štvrtá, piata alebo prvá a taktiež aj druhá apod. Teda všetky možnosti (kombinácie) okrem možnosti ani jedna. Preto:

P(aspoň jedna) = 1 – P(ani jedna)

image







S tak vysokou pravdepodobnosťou je viac menej jasné, že Adam sa nemá čoho obávať alebo mať zbytočné depresie Úsmev.  Touto interpretáciou náš kamarát Adam bude mať určite viac elánu a chuti hľadať si svoju spriaznenú dušičku. Nastal čas opustiť Adama a pozrieť sa tak trochu do Excel-u a preto sample file vás neminie.
Pre výpočet pravdepodobnosti používame funkciu =BINOM.DIST(počet úspechov;počet možností;pravdepodobnosť úspechu;0 – separovaná pravdepodobnosť, 1- kumulovaná pravdepodobnosť).

image

Je vidieť, že kumulovaný súčet separovaných pravdepodobností je rovný distribučnej funkcii (viď graf).

image
Charakteristiky Binomicky rozdelenej náhodnej veličiny
Uvažujme všetkých n dievčat zvlášť, teda Alternatívne rozdelené pravdepodobnosti úspechu.

image

S momentovou funkciou:

image

ďalej chceme vedieť ako je rozdelená štatistika úhrnu {y}.

image

Táto štatistika je vlastne pozmenený pohľad, v ktorom “hádžeme Adamove dievčatá do jedného vreca”. Odvoďme si momentovú funkciu:
image












Táto funkcia je momentovou vytvárajúcou funkciou Binomického rozdelenia a analogicky ako pri Alternatívnom z nej dostaneme nasledujúce charakteristiky polohy a variability:

image














Myslím, že to by bolo asi všetko k Binomickému rozdeleniu, nabudúce ochutnáme Poissonovo rozdelenie.

Binomické rozdelenie (I <3 shopping)

 

Chodíte radi nakupovať a nepoznáte Binomické rozdelenie? Potom je na čase, aby ste sa s nim oboznámili! Ako ste si už určite zvykli, sample file je opäť k dispozícii, takže po stiahnutí môžeme pekne začať príkladom.

Predstavte si svoj obľúbený obchod, do ktorého zavítate vždy, ak máte chuť utratiť zopár €. Elektronika, oblečenie, topánky, kabelky, v podstate je to jedno. Každý obchod tvorí určitý marketing, aby si budoval klientelu.

Predstavme si, že dostaneme 5000€, ktoré máme v priebehu nasledujúceho mesiaca rozdať ľuďom vo forme darčekových poukážok tak, aby sme oslovili tých s najväčšou lojalitou!

Niektorí z vás si povedia, čo je na tom tak zložité – vezmem  a rozdám každému, kto navštívi obchod a zopár € tam utratí. No v skutočnosti to vyzerá tak, že zdanlivo minorita zákazníkov permanentne vytvára majoritnú časť tržby! Chceme azda peniaze rozdať tým, ktorí utrácajú len ak sú výpredaje a diskonty? Nie! Chceme sa odvďačiť tým, ktorí si poctivo aktualizujú šatník a sú zdravými piliermi brandu. Vráťme sa k našim 5000€ a kvázi investičnej úlohe. Investičná v zmysle – ak oslovíte lojálneho zákazníka, ten v skutočnosti utratí omnoho viac, než by sme si dokázali predstaviť, on je povedzme dojná kravička nášho biznisu.

Ako ich vyselektovať? Sú na to rôzne spôsoby z oblasti dataminingu a štatistických metód, ktoré nie sú lacná záležitosť avšak retailovo orientovaná spoločnosť sa v dnešnej dobre bez nich nezaobíde. Povedzme, že sme na základe regresnej analýzy určili tri možné scenáre počtu nakupujúcich pre budúci mesiac:

image

Vezmime si údaje o nákupoch za posledné tri mesiace a zistíme, že množstvo ľudí, ktorí utrácajú sa zvyšuje s príchodom leta (Máj – 72, Jún – 85, Júl –96). Výstup z externého dataminingového modelu hovorí ,že  ľudia, ktorých platby presahujú hranicu 60€ sú cieľová skupina, skupina na ktorú je potreba cieľovať kupóny, zľavy benefity a iné nástroje komunikácie.

Z disponibilných štatistík za posledné tri mesiace zistíme relatívnu početnosť ľudí, ktorí utratili viac ako 60€. Použijeme funkciu =COUNTIF(B3:B98;">60")/COUNT(B3:B98).

Tieto relatívne početnosti budeme používať v modeli binomického rozdelenia, ktoré vyzerá takto:

image

V danej pravdepodobnostnej funkcii používame relatívnu početnosť  p ako odhad pravdepodobnosti výskytu javu. Použiteľný vzorec bude vyzerať nasledovne:

image

A v Exceli máme funkciu =BINOM.DIST(Počet úspechov;Počet všetkých pokusov;p;0-pravdepodobnosť alebo 1-distribučná funkcia), ktorá počíta pravdepodobnosť výskytu javu, resp. kumulovanú pravdepodobnosť.

Stredná hodnota a rozptyl rozdelenia vyzerajú nasledovne:

image image

Nasledujúca tabuľka nám ukáže hodnoty pravdepodobnosti, že náhodný kupujúci v obchode dostane zľavu, plus očakávaný počet takýchto šťastlivcov spolu so smerodajnou odchýlkou.

image

Ako nasledujúce dáta môžeme použiť? Zatiaľ sme nehovorili o veľkosti zľavy, resp. ako rozdeliť tých 5000€ pre skupinu vyvolených! V tomto prípade musíme byť opatrní, nemôžeme prehliadnuť rozpočet!!! Použijeme dva prístupy.

Prvý: odhadneme počty bonusových zákazníkov pomocou súčtu strednej hodnoty a smerodajnej odchýlky. Následne predelíme rozpočet množstvom očakávaných ľudí.

Druhý: pomocou funkcie =BINOM.INV(počet pokusov;p;0,95) vypočítame množstvo prípadov, pre ktoré by binomicky rozdelený náhodný jav mal nastať s pravdepodobnosťou 0.95 (interval spoľahlivosti). Tieto hodnoty taktiež použijeme na predelenie rozpočtu a výsledok je k dispozícii tu:

image

V našom prípade, kedy potrebujeme byť maximálne opatrní, vyberieme si ten najpriaznivejší scenár o počte zákazníkov, takže obmedzíme výšku bonusového kupónu na 60€. Úloha tvorby benefičných programov a celkovo vernostných stratégií je enormne citlivá problematika. Je preto nevyhnutné jej venovať dostatok pozornosti a HLAVNE používať sofistikované štatistické prístupy.

V nasledujúcom diele si ešte ukážeme ostatné charakteristiky a taktiež vzhľad binomického rozdelenia.

Charakteristiky náhodnej veličiny (4.diel)






Šikmosť a špicatosť



Tieto charakteristiky bude tak trocha problematické vysvetliť, nakoľko sme si nedefinovali jedno z asi najviac skloňovaných pravdepodobnostných rozdelení: Normálne rozdelenie. Zatiaľ si ukážeme iba postup, ako takéto rozdelenie modelovať! Stiahnite si prosím nový sample file a môžeme začať.
 

V prvom rade si musíme nagenerovať hodnoty náhodnej veličiny od -4 do 4 simage absolútnym prírastom 0.01. Tieto hodnoty dostaneme napríklad tým, že do bunky A2 vložíme hodnotu –4 a v A3 bunke napíšeme vzorec =A2+0,01. Tento vzorec skopírujeme a vložíme do oblasti od A3 do A802. Tento stĺpec si označíme ako x a potom sa budeme v ďalšom stĺpci f(x) zaoberať nasledujúcou hustotou pravdepodobnosti:
 

image
 

Daný vzorec môžeme napísať takto: =(1/POWER(2*PI();0,5))*EXP(1)^(-0,5*(A3^2)), kde pomocou funkcie POWER vytvoríme odmocninu, PI() je zase Ludolfovo číslo a EXP(1) pre zmenu Eulerovo. Následne sa pokúsime z vytvorených stĺpcov vytvoriť graf (Scatter) a výsledok by mal vyzerať nasledovne:

image


Tento typ rozdelenia sa tiež nazýva normované normálne rozdelenie, ktoré je charakteristické tým, že jeho stredná hodnota je rovná 0, rozptyl je rovný 1, šikmosť a špicatosť 0. A práve pomocou tohto normovaného rozdelenia sa riadia charakteristiky šikmosti a špicatosti.
 

Pri týchto charakteristikách je potrebné zaviesť pojem NORMOVANIE. Jedná sa spravidla o štatistiku, v ktorej od hodnoty X odčítame jej strednú hodnotu E(X) a potom celý výraz predelíme smerodajnou odchýlkou. image

Táto veličina  sa v literatúre zvykne označovať písmenom U. Tento proces normovania využijeme pri výstavbe momentových charakteristík:

image

Ako iste tušíte, výraz s integrálom je popis momentovej charakteristiky pri spojitých veličinách a druhý zo sumou pre nespojité veličiny. Nás budú zaujímať momenty: Tretí (šikmosť) a štvrtý (špicatosť). Tým pádom šikmosť môžeme matematicky zapísať ako:

image

Táto štatistika nám ukazuje, do ktorej strany sa zobrazuje prevažná časť prípadov v rozdelení, teda či je zošikmená doprava alebo doľava. Pre špicatosť samozrejme platí:

image


Číslo –3 som použil v rámci zaužívaného postupu, ktorý sa odkazuje na hodnotu normovaného normálneho rozdelenia, ktorého špicatosť je rovná 3. Takto sa štatistika nazýva koeficient špicatosti a primárne porovnáva špicatosť (hrot histogramu) dátového súboru hodnôt s týmto štandardným rozdelením.
 

Pre ilustráciu si urobíme taký malý pokus. Vygenerujeme si tri premenné s 20000 hodnotami normovaného normálneho rozdelenia a vypočítame si všetky základné charakteristiky. Pre výpočet šikmosti použijeme funkciu =SKEW(), kde v zátvorke označíme výberový súbor. Analogicky pre špicatosť použijeme funkciu =KURT().
 

Ak vychádzame z toho, že poznáme rozdelenie, z ktorého boli hodnoty vygenerované, vieme veľmi dobre, že stredná hodnota (priemer je v tomto prípade nestranný odhad) má byť rovná 0. Pre rozptyl platí teoretická hodnota rovná 1 a šikmosť spolu so špicatosťou má byť rovná 0.
 

TOTO je PRÍKLAD toho, AKO sa ODLIŠUJÚ teoretické HODNOTY od EMPIRICKÝCH! Nabudúce si budeme ukazovať zopár zaujímavých rozdelení náhodných veličín.