חסם קרמר–ראו
פעולות נוספות
בתורת האמידה ובסטטיסטיקה, חסם קרַמר–ראו (באנגלית: <phonos ipa="" lang="he" text="<span dir="auto">Cramér–Rao bound</span>" wikibase="no entity" file="">Cramér–Rao bound</phonos>Ⓘ, בראשי תיבות: CRB; נקרא גם Cramér–Rao lower bound, בראשי תיבות: CRLB) הוא חסם תחתון על השונות של אומדים של פרמטרים דטרמיניסטיים. לעיתים הוא ידוע בשמות "אי-שוויון קרמר–ראו" או "אי-שוויון האינפורמציה". הוא נקרא על שם הראלד קרמר וק. ר. ראו, שהיו בין הראשונים לקבל אותו.
בצורתו הפשוטה ביותר, החסם קובע שהשונות של כל אומד חסר הטיה היא חסומה מלמטה על ידי ההופכי של האינפורמציה של פישר. אומד חסר הטיה שהשונות שלו שווה לחסם נקרא אומד יעיל (efficient). לאומד כזה השגיאה הריבועית הממוצעת הנמוכה ביותר מבין כל האומדים חסרי ההטיה, ולכן הוא נקרא גם אומד חסר הטיה בעל שונות מינימלית במידה שווה (uniformly minimum-variance unbiased estimator – UMVUE). עם זאת, לעיתים לא קיים אומד חסר-הטיה שמשיג את החסם, אף במקרה שיש אומד שהשונות שלו היא הקטנה ביותר מכל שאר האומדים.
גרסה מוכללת של חסם קרמר–ראו נותנת חסם גם עבור השונות של אומדים בעלי-הטיה ידועה. במקרים מסוימים, אומד מוטה עשוי להניב שגיאה ריבועית ממוצעת ושונות נמוכות יותר מאלו שמשיג חסם קרמר–ראו עבור אומר חסר-הטייה.
תנאים רגולריים עריכה
החסם תקף תחת שני תנאים רגולריים חלשים יחסית על פונקציית צפיפות ההסתברות <math>f(x; \theta)</math>:
- האינפורמציה של פישר מוגדרת היטב, כלומר לכל <math>x</math> שבו <math>f(x; \theta)>0</math>, הנגזרת <math> \frac{\partial}{\partial\theta} \ln f(x;\theta)</math> קיימת והיא סופית.
- ניתן להחליף את הסדר של גזירה לפי <math>\theta</math> ואינטגרציה לפי <math>x</math>. התנאי הזה מתקיים כאשר אחד מהבאים מתקיים:
- הפונקציה <math>f(x; \theta)</math> היא בעלת תומך סופי ב-<math>x</math>, שגבולותיו אינם תלויים ב-<math>\theta</math>.
- הפונקציה <math>f(x; \theta)</math> היא בעלת תומך אינסופי, גזירה ברציפות, והאינטגרל מתכנס במידה שווה לכל <math>\theta</math>.
החסם עריכה
אומד סקלרי עריכה
אומד חסר-הטיה של פרמטר עריכה
יהי <math>\theta</math> פרמטר דטרמיניסטי לא-ידוע הנאמד בעזרת וקטור של <math>n</math> מדידות של <math>x</math>. צפיפות ההסתברות של המדידות, שתלויה בפרמטר, היא <math>f(x; \theta)</math>. השונות של כל אומד חסר-הטיה <math>\hat{\theta}</math> של הפרמטר <math>\theta</math> חסום על ידי ההופכי של האינפורמציה של פישר:
- <math>\mathrm{Var}(\hat{\theta})
\geq \frac{1}{I(\theta)} </math>
האינפורמציה של פישר במקרה הסקלרי <math>I(\theta)</math>, מוגדרת לפי:
- <math>
I(\theta) = n \operatorname{E}_{X;\theta}
\left[
\left(
\frac{\partial \ell(X;\theta)}{\partial\theta}
\right)^2
\right]
</math>
כאשר <math>\ell(x;\theta)=\ln (f(x;\theta))</math> היא הלוגריתם הטבעי של פונקציית הנראות של דגימה יחידה <math>x</math> ו־<math>\operatorname{E}_{x;\theta}</math> היא התוחלת לפי הצפיפות <math>f(x;\theta)</math> של <math>X</math>. אם לא כתוב אחרת להלן, התוחלת היא תוחלת לפי <math>X</math>.
אם <math>\ell(x;\theta)</math> גזירה פעמיים ותנאים רגולריים מסוימים מתקיימים, אזי ניתן להגדיר את האינפורמציה של פישר גם כך:[1]
- <math>
I(\theta) = -n \operatorname{E}_{X;\theta}\left[ \frac{\partial^2 \ell(X;\theta)}{\partial\theta^2} \right] </math>
היעילות (אנ') של אומד חסר הטיה <math>\hat{\theta}</math> מורה כמה קרובה שונות האומד לחסם התחתון; יעילות אומד מוגדרת כך:
- <math>e(\hat{\theta}) = \frac{I(\theta)^{-1}}{\operatorname{Var}(\hat{\theta})}</math>
כלומר היחס בין השונות המינימלית האפשרית עבור אומד חסר הטיה לבין השונות שלו בפועל. חסם קרמר–ראו קובע:
- <math>e(\hat{\theta}) \le 1</math>.
אומד חסר-הטיה של פונקציה של פרמטר עריכה
צורה כללית יותר של החסם מתקבלת עבור מקרה של אומד חסר הטיה, <math>\hat{\psi}=T(X)</math>, שנועד לאמוד את <math>\psi(\theta)</math>, פונקציה ידועה של פרמטר סקלרי דטרמיניסטי לא-ידוע <math>\theta</math>. משמעות חוסר ההטיה היא שמתקיים <math>E\left[T(X)\right]=\psi(\theta)</math>. במקרה זה, החסם הוא:
- <math>
\mathrm{Var}(T(X)) \geq \frac{(\psi'(\theta))^2}{I(\theta)} </math>
כאשר <math>\psi'(\theta)</math> היא הנגזרת של <math>\psi(\theta)</math> לפי <math>\theta</math>, ו־<math>I(\theta)</math> היא האינפורמציה של פישר, כפי שהוגדרה לעיל.
אומד מוטה של פרמטר עריכה
ניתן להכליל את החסם עבור אומד של פרמטר <math>\theta</math> בעל הטיה ידועה, <math>b(\theta) = E[\hat{\theta}]-\theta</math>. נסמן:
- <math>\psi(\theta)\equiv E[\hat{\theta}]=\theta+b(\theta)</math>,
ולפיכך מתקיים:
- <math>\psi'(\theta)=(\theta+b(\theta))'=1+b'(\theta)</math>.
השונות של כל אומד חסר הטיה שהתוחלת שלו היא <math>\psi(\theta)</math> חסומה על ידי הביטוי שלעיל; במילים אחרות, השונות של כל אומד <math>\hat{\theta}</math> שהטייתו <math>b(\theta)</math> ידועה, חסומה על ידי:
- <math>
\mathrm{Var} (\hat{\theta}) \geq \frac{(1+b'(\theta))^2}{I(\theta)} </math>. כאשר <math>b'(\theta)</math> היא הנגזרת של <math>b(\theta)</math> לפי <math>\theta</math>.
ניתן לראות כי תוצאה זו מתכנסת לנוסחה עבור אומד חסר-ההטיה עבור <math>b(\theta)=0</math>.
אם כן, השגיאה הריבועית הממוצעת של כל אומד מוטה חסומה על ידי:
- <math>\mathrm{E}\left[(\hat{\theta}-\theta)^2\right]\geq\frac{(1+b'(\theta))^2}{I(\theta)}+b(\theta)^2</math>.
אומד כללי עריכה
הצורה הכללית ביותר של החסם עבור אומד סקלרי היא עבור אומד מוטה של פונקציה של פרמטר <math>\hat{\psi}=T(X)</math>, שנועד לאמוד את <math>\psi(\theta)</math>, פונקציה ידועה של פרמטר סקלרי דטרמיניסטי לא-ידוע <math>\theta</math>. משמעות ההטיה היא ש־<math>b(\theta) = E[T(X)]-\psi(\theta)</math> לא בהכרח שווה ל־0.
במקרה זה, החסם הוא:
- <math>\mathrm{Var}(T(X))
\geq \frac{(\psi'(\theta)+b'(\theta))^2}{I(\theta)} </math>
אומד וקטורי כללי עריכה
ניתן להכליל את החסם עבור וקטור של פרמטרים לא-ידועים, המוגדר:
- <math>\boldsymbol{\theta} = \left[ \theta_1, \theta_2, \dots, \theta_d \right]^T \in \mathbb{R}^d</math>
כאשר פונקציית הצפיפות <math>f(x; \boldsymbol{\theta})</math> מקיימת את התנאים הרגולריים לעיל.
במקרה זה, החסם דומה מאוד, אלא שכעת צורתו וקטורית: האינפורמציה של פישר היא מטריצה <math>d \times d</math>, ולא סקלר, ואת שונות האומד מחליפה מטריצת השונות המשותפות של אומד פונקציה כלשהי של וקטור הפרמטרים, המסומן <math>\boldsymbol{T}(X)</math>.
האיבר ה־<math>I_{m, k}</math> במטריצת האינפורמציה של פישר מוגדר:
- <math>
I_{m, k} = \operatorname{E} \left[
\frac{\partial }{\partial \theta_m} \log f\left(x; \boldsymbol{\theta}\right)
\frac{\partial }{\partial \theta_k} \log f\left(x; \boldsymbol{\theta}\right)
\right] = -\operatorname{E} \left[
\frac{\partial ^2}{\partial \theta_m \, \partial \theta_k} \log f\left(x; \boldsymbol{\theta}\right)
\right] </math>
והמטריצה בכללה היא:
- <math>
I = \mathrm{E} \left[
\frac{\partial^T}{\partial\boldsymbol{\theta}} \log f\left(x; \boldsymbol{\theta}\right)
\frac{\partial}{\partial\boldsymbol{\theta}} \log f\left(x; \boldsymbol{\theta}\right)
\right] </math>
במילים אחרות, מטריצת האינפורמציה של פישר היא תוחלת המכפלה החיצונית של גרדיאנט פונקציית לוג-הנראות עם עצמו.
יהי <math>\boldsymbol{T}(X)</math> אומד של פונקציה כלשהי של וקטור הפרמטרים <math>\boldsymbol{\theta}</math>:
- <math>\boldsymbol{T}(X) = (T_1(X), \ldots, T_d(X))^T</math>
נסמן את קטור התוחלות <math>\mathrm{E}[\boldsymbol{T}(X)]</math> ב־<math>\boldsymbol{\psi}\left(\boldsymbol{\theta}\right)</math>.
חסם קרמר–ראו קובע כי מטריצת השונות המשותפות (Covariance Matrix) של <math>\boldsymbol{T}(X)</math> מקיימת:
- <math>
I\left(\boldsymbol{\theta}\right) \geq \phi(\theta)^T \operatorname{Cov}_{\boldsymbol{\theta}}\left(\boldsymbol{T}(X)\right)^{-1}\phi(\theta) </math>,
- <math>
\operatorname{Cov}_{\boldsymbol{\theta}}\left(\boldsymbol{T}(X)\right) \geq \phi(\theta) I\left(\boldsymbol{\theta}\right)^{-1} \phi(\theta)^T </math>
כאשר:
- האי-שוויון הוא אי-שוויון מטריצי, כלומר ההפרש בין אגף שמאל לאגף ימין הוא מטריצה חיובית למחצה (Positive semi-definite).
- <math>\phi(\theta) := \partial \boldsymbol{\psi}(\boldsymbol{\theta})/\partial \boldsymbol{\theta}</math> היא מטריצת יעקובי שהאיבר ה־<math>ij</math> שלה הוא <math>\partial \psi_i(\boldsymbol{\theta})/\partial \theta_j</math>.
במקרה הפרטי הפשוט שבו <math>\boldsymbol{T}(X)</math> הוא אומד חסר-הטיה של <math>\boldsymbol{\theta}</math> (כלומר <math>\boldsymbol{\psi}\left(\boldsymbol{\theta}\right) = \boldsymbol{\theta}</math>), חסם קרמר–ראו מצטמצם לצורה:
- <math>
\operatorname{Cov}_{\boldsymbol{\theta}}(\hat{\boldsymbol{\theta}}) \geq I\left(\boldsymbol{\theta}\right)^{-1} </math>
צורה זו מזכירה מאוד את המקרה הסקלרי.
אם מסובך להפוך את מטריצת האינפורמציה של פישר, ניתן פשוט לקחת את ההופכי של האלמנט האלכסוני הרצוי כדי למצוא גבול תחתון, אם כי ייתכן שהוא יהיה מעט נמוך מהגבול התחתון האמיתי שיביא היפוך המטריצה:[2]
- <math>
\operatorname{Var}_{\boldsymbol{\theta}}(T_m(X)) = \left[\operatorname{Cov}_{\boldsymbol{\theta}}\left(\boldsymbol{T}(X)\right)\right]_{mm} \geq \left[I\left(\boldsymbol{\theta}\right)^{-1}\right]_{mm} \geq \frac{1}{I\left(\boldsymbol{\theta}\right)_{mm}} </math>
הוכחת החסם עריכה
ההוכחה הבאה היא זו של המקרה הסקלרי הכללי שהוצג לעיל.
נניח ש-<math>X</math> הוא משתנה מקרי עם פונקציית צפיפות הסתברות <math>f(x; \theta)</math>, וש-<math>T=t(X)</math> הוא אומד של <math>\psi(\theta)</math>. יהי <math>V</math> הניקוד (score) של הפילוג:
- <math>V = \frac{\partial}{\partial\theta} \ln f(X;\theta)</math>
התוחלת של הניקוד:
- <math> \begin{align}
\mathrm{E} \left[V\right] & =\mathrm{E} \left[\frac{\partial}{\partial\theta} \ln f(X;\theta)\right] \\ & =\int\frac{\partial}{\partial\theta} \ln f(x;\theta) \cdot f(x;\theta) \, dx \\ & =\int\frac{\partial}{\partial\theta} f(x;\theta) \, dx \\ & =\frac{\partial}{\partial\theta} \int f(x;\theta) \, dx \\ & =\frac{\partial}{\partial\theta} (1) \\ & = 0 \end{align}</math> כאשר החלפת סדר הגזירה והאינטגרציה אפשרית בהנחה שהתנאים הרגולריים מתקיימים.
השונות המשותפת של <math>V</math> ושל <math>T</math>:
- <math>\begin{align}
\mathrm{Cov}(V,T) & =\mathrm{E} \left[T\cdot V\right]-\mathrm{E} \left[T\right]\cdot \mathrm{E} \left[V\right] \\ & =\mathrm{E} \left[T\cdot \frac{\partial}{\partial\theta} \ln f(X;\theta)\right] \\ & =\int t(x) \frac{\partial}{\partial\theta} f(x;\theta) \, dx \\ & =\frac{\partial}{\partial\theta} \int t(x) f(x;\theta) \, dx \\ & =\frac{\partial}{\partial\theta} \mathrm{E} \left[T(X) \right] \end{align}</math> מאחר ש-<math>T(X)</math> הוא אומד חסר הטיה, מתקבל:
- <math>\mathrm{Cov}(V,T)=\frac{\partial}{\partial\theta} \psi(\theta)=\psi'(\theta)</math>
לפי אי-שוויון קושי-שוורץ, מתקיים:
- <math>\left[\mathrm{Cov}(T,V)\right]^2 \le \mathrm{Var}(T) \cdot \mathrm{Var}(V)</math>
השונות של <math>V</math> היא גם האינפורמציה של פישר (לפי הגדרה), ולכן יתקבל בהצבה לאי-שוויון:
- <math>\mathrm{Var}(T) \ge \frac{\left[\psi'(\theta)\right]^2}{\mathrm{Var}(V)}=\frac{\left[\psi'(\theta)\right]^2}{I(\theta)}</math>
שהוא החסם המבוקש.
דוגמה: חסם קרמר–ראו עבור משתני אינדיקטור עריכה
נחפש את חסם קרמר–ראו עבור מודל שבו <math>Y_1,...Y_n \sim Bin(1,p)</math>. מכאן שפונקציית הנראות היא:
- <math>L(p,Y_1,...Y_n)= p^{\sum(Y_i)}\cdot(1-p)^{n-\sum(Y_i)}</math>
כדי לקבל את האינפורמציה של פישר, צריך לחשב את לוגריתם הנראות:
- <math>l(p,Y_1,..Y_n)=\log{L}=\sum y_i \cdot\log p + (n-\sum Y_i)\log (1-p)</math>
מגזירה מתקבל:
- <math>l^{\prime} =(\sum Y_i - np)/(p\cdot(1-p))</math>,
ולכן האינפורמציה של פישר היא:
- <math>E((l^\prime)^2)=\frac{E(\sum Y_i - np)^2}{p^2 (1-p)^2} = \frac{n}{p(1-p)} </math>
ולפי חסם קרמר–ראו עבור כל אומד חסר הטיה <math>\hat{p}</math>, מתקיים:
- <math>\mathrm{Var}(\hat{p}) \ge \frac{p(1-p)}{n}</math>
ראו גם עריכה
לקריאה נוספת עריכה
- Kay, Steven M. (1993). Fundamentals of Statistical Signal Processing, Volume I: Estimation Theory. Prentice Hall.
- Shao, Jun (1998). Mathematical Statistics. New York: Springer.
הערות שוליים עריכה
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ For the Bayesian case, see eqn. (11) of שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).