<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="he">
	<id>https://www.yisraelpedia.com/index.php?action=history&amp;feed=atom&amp;title=%D7%9E%D7%95%D7%93%D7%9C_%D7%A9%D7%A4%D7%94</id>
	<title>מודל שפה - היסטוריית גרסאות</title>
	<link rel="self" type="application/atom+xml" href="https://www.yisraelpedia.com/index.php?action=history&amp;feed=atom&amp;title=%D7%9E%D7%95%D7%93%D7%9C_%D7%A9%D7%A4%D7%94"/>
	<link rel="alternate" type="text/html" href="https://www.yisraelpedia.com/index.php?title=%D7%9E%D7%95%D7%93%D7%9C_%D7%A9%D7%A4%D7%94&amp;action=history"/>
	<updated>2026-09-14T11:54:50Z</updated>
	<subtitle>היסטוריית הגרסאות של הדף הזה בוויקי</subtitle>
	<generator>MediaWiki 1.43.8</generator>
	<entry>
		<id>https://www.yisraelpedia.com/index.php?title=%D7%9E%D7%95%D7%93%D7%9C_%D7%A9%D7%A4%D7%94&amp;diff=860455&amp;oldid=prev</id>
		<title>imported&gt;Gili GanL: בכדי להראות שמדובר בו&quot;ו החיבור.</title>
		<link rel="alternate" type="text/html" href="https://www.yisraelpedia.com/index.php?title=%D7%9E%D7%95%D7%93%D7%9C_%D7%A9%D7%A4%D7%94&amp;diff=860455&amp;oldid=prev"/>
		<updated>2026-04-10T06:14:41Z</updated>

		<summary type="html">&lt;p&gt;בכדי להראות שמדובר בו&amp;quot;ו החיבור.&lt;/p&gt;
&lt;p&gt;&lt;b&gt;דף חדש&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;מודל שפה&amp;#039;&amp;#039;&amp;#039; הוא מודל [[הסתברות|הסתברותי]] של שפה טבעית. &amp;lt;ref&amp;gt;{{צ-ספר|מחבר=Christopher Manning and Hinrich Schütze|שם=Foundations of statistical natural language processing|מו&amp;quot;ל=MIT|שנת הוצאה=1999|ISBN=9780262133609}}&amp;lt;/ref&amp;gt; הדוגמאות המוכרות ביותר של שימוש במודלי שפה הן &amp;quot;השלמה אוטומטית&amp;quot;, המציעה את המילה או המילים הכי סבירות להשלמת טקסט שהוקלד עד כה, וכן כלי [[בינה מלאכותית]] טקסטואליים בגרסתם המתקדמת כ[[מודל שפה גדול|מודלי שפה גדולים]] דוגמת [[ChatGPT]] או [[Bard|Gemini]].&lt;br /&gt;
&lt;br /&gt;
מודלי שפה משמשים עבור מגוון בעיות ב[[בלשנות חישובית]]; [[מערכת זיהוי דיבור|זיהוי דיבור והפיכתו לטקסט]], כדי להבטיח שרצפי מילים בסבירות נמוכה לא יופיעו, ועד לשימוש רחב יותר ב[[תרגום מכונה]], יצירת טקסט ממוכן דמוי אדם, זיהוי חלקי דיבור, [[זיהוי תווים אופטי]], [[זיהוי ממוחשב של כתב יד]], ויישומים נוספים.&lt;br /&gt;
&lt;br /&gt;
== סוגי מודלים ==&lt;br /&gt;
=== Unigram ===&lt;br /&gt;
ניתן להתייחס למודל Unigram כשילוב של כמה [[אוטומט סופי|אוטומטים סופיים]] של מצב אחד.&amp;lt;ref&amp;gt;Christopher D. Manning, Prabhakar Raghavan, Hinrich Schütze: An Introduction to Information Retrieval, pages 237–240. Cambridge University Press, 2009&amp;lt;/ref&amp;gt; המודל מניח שההסתברויות של אסימונים ברצף אינן תלויות, למשל:&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P_\text{uni}(t_1t_2t_3)=P(t_1)P(t_2)P(t_3).&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
במודל זה, ההסתברות של כל מילה תלויה רק בהסתברות של אותה מילה במסמך, כך שיש לנו רק אוטומטים סופיים של מצב אחד כיחידות. לאוטומט עצמו יש התפלגות הסתברות על כל אוצר המילים של המודל, המסתכמת ל-1. להלן איור של דגם Unigram של מסמך.&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
!תנאים&lt;br /&gt;
! הסתברות במסמך&lt;br /&gt;
|-&lt;br /&gt;
| a&lt;br /&gt;
| 0.1&lt;br /&gt;
|-&lt;br /&gt;
| world&lt;br /&gt;
| 0.2&lt;br /&gt;
|-&lt;br /&gt;
| likes&lt;br /&gt;
| 0.05&lt;br /&gt;
|-&lt;br /&gt;
| we&lt;br /&gt;
| 0.05&lt;br /&gt;
|-&lt;br /&gt;
| share&lt;br /&gt;
| 0.3&lt;br /&gt;
|-&lt;br /&gt;
| ...&lt;br /&gt;
| ...&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\sum_{\text{term in doc}} P(\text{term}) = 1&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
ההסתברות שנוצרת עבור שאילתה ספציפית מחושבת כ&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(\text{query}) = \prod_{\text{term in query}} P(\text{term})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
למסמכים שונים יש מודלי Unigram, עם הסתברויות פגיעה שונות של מילים. התפלגויות ההסתברות ממסמכים שונים משמשות ליצירת הסתברויות פגיעה עבור כל שאילתה. ניתן לדרג מסמכים עבור שאילתה לפי ההסתברויות. דוגמה למודלי Unigram של שני מסמכים:&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
!תנאים&lt;br /&gt;
! הסתברות ב-Doc1&lt;br /&gt;
! הסתברות ב-Doc2&lt;br /&gt;
|-&lt;br /&gt;
| a&lt;br /&gt;
| 0.1&lt;br /&gt;
| 0.3&lt;br /&gt;
|-&lt;br /&gt;
| world&lt;br /&gt;
| 0.2&lt;br /&gt;
| 0.1&lt;br /&gt;
|-&lt;br /&gt;
| likes&lt;br /&gt;
| 0.05&lt;br /&gt;
| 0.03&lt;br /&gt;
|-&lt;br /&gt;
| we&lt;br /&gt;
| 0.05&lt;br /&gt;
| 0.02&lt;br /&gt;
|-&lt;br /&gt;
| share&lt;br /&gt;
| 0.3&lt;br /&gt;
| 0.2&lt;br /&gt;
|-&lt;br /&gt;
| ...&lt;br /&gt;
| ...&lt;br /&gt;
| ...&lt;br /&gt;
|}&lt;br /&gt;
בהקשרים של אחזור מידע, מודלי Unigram מופשטים לעיתים קרובות כדי למנוע מקרים שבהם &amp;#039;&amp;#039;P&amp;#039;&amp;#039; (מונח)=0. גישה נפוצה היא ליצור מודל סבירות מקסימלית עבור כל האוסף [[אינטרפולציה ליניארית|ואינטרפולציה ליניארית]] של מודל האוסף עם מודל סבירות מקסימלית עבור כל מסמך כדי לפשט את המודל.&amp;lt;ref&amp;gt;Buttcher, Clarke, and Cormack. Information Retrieval: Implementing and Evaluating Search Engines. pg. 289–291. MIT Press.&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== n-gram ===&lt;br /&gt;
במודל n-gram, ההסתברות &amp;lt;math&amp;gt;P(w_1,\ldots,w_m)&amp;lt;/math&amp;gt; של התבוננות במשפט &amp;lt;math&amp;gt;w_1,\ldots,w_m&amp;lt;/math&amp;gt; משוער כ&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(w_1,\ldots,w_m) = \prod^m_{i=1} P(w_i\mid w_1,\ldots,w_{i-1})\approx \prod^m_{i=2} P(w_i\mid w_{i-(n-1)},\ldots,w_{i-1})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
ההנחה היא שההסתברות להתקלות במילה &amp;#039;&amp;#039;&amp;lt;sup&amp;gt;ה-&amp;lt;/sup&amp;gt; i&amp;#039;&amp;#039; &amp;#039;&amp;#039;w &amp;lt;sub&amp;gt;i&amp;lt;/sub&amp;gt;&amp;#039;&amp;#039; בהיסטוריית ההקשר של ה- &amp;#039;&amp;#039;i&amp;#039;&amp;#039; הקודם - ניתן להעריך 1 מילים לפי ההסתברות להתבונן בה בהיסטוריית ההקשר המקוצרת של ה- &amp;#039;&amp;#039;n&amp;#039;&amp;#039; הקודמת - 1 מילים ( נכס מרקוב &amp;lt;sup&amp;gt;מסדר&amp;lt;/sup&amp;gt; &amp;#039;&amp;#039;n&amp;#039;&amp;#039; ). כדי להבהיר, עבור &amp;#039;&amp;#039;n=3&amp;#039;&amp;#039; ו- &amp;#039;&amp;#039;i=2&amp;#039;&amp;#039; יש לנו &amp;lt;math&amp;gt;P(w_i\mid w_{i-(n-1)},\ldots,w_{i-1})=P(w_2\mid w_1)&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
ניתן לחשב את ההסתברות המותנית מתוך ספירת תדירות של מודל n-gram:&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(w_i\mid w_{i-(n-1)},\ldots,w_{i-1}) = \frac{\mathrm{count}(w_{i-(n-1)},\ldots,w_{i-1},w_i)}{\mathrm{count}(w_{i-(n-1)},\ldots,w_{i-1})}&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
מודלי &amp;#039;&amp;#039;&amp;#039;bigram ו־trigram&amp;#039;&amp;#039;&amp;#039; מציינים מודלי n-gram עם &amp;#039;&amp;#039;n&amp;#039;&amp;#039;=2 ו- &amp;#039;&amp;#039;n&amp;#039;&amp;#039;=3, בהתאמה.&amp;lt;ref&amp;gt;Craig Trim, [http://trimc-nlp.blogspot.com/2013/04/language-modeling.html &amp;#039;&amp;#039;What is Language Modeling?&amp;#039;&amp;#039;], April 26th, 2013.&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
בדרך כלל, הסתברויות מודל n-gram אינן נגזרות ישירות מספירת תדרים, מכיוון שבמודלים שנגזרו כך צפות בעיות כאשר הם מתמודדים עם n-gram כלשהם שלא נראו במפורש קודם לכן.&lt;br /&gt;
&lt;br /&gt;
במקום זאת, נחוצה צורה כלשהי של &amp;quot;החלקה&amp;quot;, הקצאת חלק ממסת ההסתברות הכוללת למילים בלתי נראות או ל-n-gram. נעשה שימוש בשיטות שונות, החל מהחלקה פשוטה של &amp;quot;הוספה אחת&amp;quot; (הקצאת ספירה של 1 ל-&amp;#039;&amp;#039;n-&amp;#039;&amp;#039; גרם בלתי נראה, כקודם לא [[הסתברות פריורית|אינפורמטיבי]]) ועד למודלים מתוחכמים יותר, כגון הנחות של Good-Turing או [[:en:Katz&amp;#039;s_back-off_model|back-off models]].&lt;br /&gt;
&lt;br /&gt;
==== דו-כיווני ====&lt;br /&gt;
ייצוגים דו-כיווניים מתנים הן לפני והן לאחר ההקשר (למשל, מילים) בכל השכבות.&lt;br /&gt;
&lt;br /&gt;
==== דוגמה ====&lt;br /&gt;
במודל שפה bigram (&amp;#039;&amp;#039;n&amp;#039;&amp;#039;=2), ההסתברות של המשפט &amp;#039;&amp;#039;שראיתי את הבית האדום&amp;#039;&amp;#039; משוערת כמו&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(\text{I, saw, the, red, house}) \approx P(\text{I}\mid\langle s\rangle) P(\text{saw}\mid \text{I}) P(\text{the}\mid\text{saw}) P(\text{red}\mid\text{the}) P(\text{house}\mid\text{red}) P(\langle /s\rangle\mid \text{house})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
ואילו במודל שפה trigram (&amp;#039;&amp;#039;נ&amp;#039;&amp;#039;=3), הקירוב הוא&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(\text{I, saw, the, red, house}) \approx P(\text{I}\mid \langle s\rangle,\langle s\rangle) P(\text{saw}\mid\langle s\rangle,I) P(\text{the}\mid\text{I, saw}) P(\text{red}\mid\text{saw, the}) P(\text{house}\mid\text{the, red}) P(\langle /s\rangle\mid\text{red, house})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
שימו לב שההקשר של ה-&amp;#039;&amp;#039;n&amp;#039;&amp;#039; הראשונה–1 &amp;#039;&amp;#039;n&amp;#039;&amp;#039; -גרם מלא בסמנים של תחילת המשפט, המסומנים בדרך כלל על ידי &amp;lt;nowiki&amp;gt;&amp;lt;s&amp;gt;&amp;lt;/nowiki&amp;gt;.&lt;br /&gt;
&lt;br /&gt;
=== אקספוננציאלי ===&lt;br /&gt;
מודלים של שפת אנטרופיה מקסימלית מקודדים את הקשר בין מילה להיסטוריה של n-gram באמצעות פונקציות תכונה. המשוואה היא&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt; P(w_m \mid w_1,\ldots,w_{m-1}) = \frac{1}{Z(w_1,\ldots,w_{m-1})} \exp (a^T f(w_1,\ldots,w_m))&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
כאשר &amp;lt;math&amp;gt;Z(w_1,\ldots,w_{m-1})&amp;lt;/math&amp;gt; היא פונקציית המחיצה, &amp;lt;math&amp;gt;a&amp;lt;/math&amp;gt; הוא וקטור הפרמטר, ו &amp;lt;math&amp;gt;f(w_1,\ldots,w_m)&amp;lt;/math&amp;gt; היא פונקציית הפיצ&amp;#039;ר. במקרה הפשוט ביותר, פונקציית התכונה היא רק אינדיקטור לנוכחות של n-gram מסוים.&lt;br /&gt;
&lt;br /&gt;
המודל הלוג-ביליניארי הוא דוגמה נוספת למודל שפה אקספוננציאלי.&lt;br /&gt;
&lt;br /&gt;
=== רשת נוירונים ===&lt;br /&gt;
מודלי שפות מבוססי [[רשת נוירונים|רשתות נוירונים]] משתמשים בייצוגים או הטמעות מתמשכות של מילים כדי לבצע את התחזיות שלהם.&amp;lt;ref&amp;gt;{{Cite web|last=Karpathy|first=Andrej|title=The Unreasonable Effectiveness of Recurrent Neural Networks|url=https://karpathy.github.io/2015/05/21/rnn-effectiveness/}}&amp;lt;/ref&amp;gt; מודלים אלה עושים שימוש ב[[רשת עצבית מלאכותית|רשתות עצביות מלאכותיות]].&lt;br /&gt;
&lt;br /&gt;
ככל שמודלי שפה מאומנים על טקסטים גדולים יותר ויותר, אוצר המילים של המודל גדל. וכך גם מספר הרצפים האפשריים של מילים גדל ב[[גדילה מעריכית|אופן אקספוננציאלי]]. דבר זה גורם לבעיה של &amp;quot;דלילות נתונים&amp;quot; בגלל הרצפים הרבים האפשריים. לפיכך, יש צורך בסטטיסטיקה כדי להעריך נכון את הסתברות הופעת המילה. רשתות נוירונים נמנעות מבעיה זו על ידי ייצוג מילים בצורה [[רשת עצבית מלאכותית|מבוזרת]], כצירופים לא ליניאריים של משקלים ב&amp;quot;רשת נוירונים&amp;quot;.&amp;lt;ref name=&amp;quot;bengio&amp;quot;&amp;gt;{{Cite encyclopedia|title=Neural net language models|first=Yoshua|last=Bengio|year=2008|encyclopedia=[[Scholarpedia]]|volume=3|page=3881|url=http://www.scholarpedia.org/article/Neural_net_language_models|doi=10.4249/scholarpedia.3881|bibcode=2008SchpJ...3.3881B}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
בדרך כלל, מודלים של שפת רשת נוירונים בנויים ומאומנים כמסווגים הסתברותיים הלומדים לחזות התפלגות הסתברות&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(w_t \mid \mathrm{context}) \, \forall t \in V&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
כלומר, הרשת מאומנת לחזות את התפלגות ההסתברות על פני אוצר המילים, בהתחשב להקשר לשוני כלשהו. זה נעשה באמצעות [[אלגוריתם|אלגוריתמים]] סטנדרטיים לאימון רשת נוירונים כגון &amp;quot;ירידה בשיפוע סטוכסטי&amp;quot; עם &amp;quot;התפשטות לאחור&amp;quot;. ההקשר עשוי להיות חלון בגודל קבוע של מילים קודמות, כך שהרשת מנבאת&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(w_t \mid w_{t-k}, \dots, w_{t-1})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
מ&amp;quot;וקטור תכונה&amp;quot; המייצג את {{Mvar|k}} המילים הקודמות. אפשרות נוספת היא להשתמש במילים &amp;quot;עתידיות&amp;quot; כמו גם במילים מה&amp;quot;עבר&amp;quot; כתכונות, כך שההסתברות המשוערת היא&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;P(w_t \mid w_{t-k}, \dots, w_{t-1}, w_{t+1}, \dots, w_{t+k})&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
זה נקרא מודל &amp;quot;שק של מילים&amp;quot; ([[:en:Bag-of-words|bag-of-words]]). כאשר וקטורי התכונה של המילים בהקשר משולבים על ידי פעולה רציפה, המודל הזה מכונה ארכיטקטורת שקית המילים הרציפה (CBOW).&lt;br /&gt;
&lt;br /&gt;
אפשרות שלישית שמתאמנת לאט יותר מה-CBOW אבל מתפקדת מעט יותר טוב היא להפוך את הבעיה הקודמת ולגרום לרשת נוירונים ללמוד את ההקשר בהינתן מילה. או בצורה מדויקת יותר, בהינתן רצף של מילות אימון &amp;lt;math&amp;gt;w_1, w_2, w_3, \dots, w_T&amp;lt;/math&amp;gt;, אחד מגדיל את ההסתברות הממוצעת לlog&lt;br /&gt;
&lt;br /&gt;
: &amp;lt;math&amp;gt;\frac{1}{T}\sum_{t=1}^T \sum_{-k \leq j \leq k, j \neq 0} \log P(w_{t+j} \mid w_t)&amp;lt;/math&amp;gt;&lt;br /&gt;
&lt;br /&gt;
כאשר {{Mvar|k}}, גודל ההקשר האימון, יכול להיות פונקציה של המילה המרכזית &amp;lt;math&amp;gt;w_t&amp;lt;/math&amp;gt;. זה נקרא מודל שפת דילוג על גרם ([[:en:Skip-gram|skip-gram]]). מודלים של שקית מילים ודילוג על גרם הם הבסיס לתוכנית [[word2vec]].&amp;lt;ref&amp;gt;{{Cite web|last=Harris|first=Derrick|date=16 August 2013|title=We&amp;#039;re on the cusp of deep learning for the masses. You can thank Google later|url=https://gigaom.com/2013/08/16/were-on-the-cusp-of-deep-learning-for-the-masses-you-can-thank-google-later/|website=Gigaom}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== מודלי שפה בולטים ==&lt;br /&gt;
מודלי שפה בסיסיים:&lt;br /&gt;
* [[GPT-2]]: Generative Pre-trained&lt;br /&gt;
* BERT: ייצוג מקודד דו-כיווני של רובוטריקים (BERT)&lt;br /&gt;
[[מודל שפה גדול|מודלי שפה גדולים]]:&lt;br /&gt;
&lt;br /&gt;
* מודל שפה כללי (GLaM) של טריליון פרמטרים, ממחקר של Google&amp;lt;ref&amp;gt;{{Cite web|last=Dai|first=Andrew M|last2=Du|first2=Nan|date=December 9, 2021|title=More Efficient In-Context Learning with GLaM|url=https://ai.googleblog.com/2021/12/more-efficient-in-context-learning-with.html|access-date=2022-12-05|website=ai.googleblog.com|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* מודלי שפה ליישומי דיאלוג (LaMDA) מודל של 137 מיליארד פרמטרים מ-Google Research&amp;lt;ref&amp;gt;{{Cite web|last=Cheng|first=Heng-Tze|last2=Thoppilan|first2=Romal|date=January 21, 2022|title=LaMDA: Towards Safe, Grounded, and High-Quality Dialog Models for Everything|url=https://ai.googleblog.com/2022/01/lamda-towards-safe-grounded-and-high.html|access-date=2022-12-05|website=ai.googleblog.com|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* Megatron-Turing מודל פרמטרים של 530 מיליארד NLG, מבית Microsoft/Nvidia&amp;lt;ref&amp;gt;{{Cite journal|last=Smith|first=Shaden|last2=Patwary|first2=Mostofa|last3=Norick|first3=Brandon|last4=LeGresley|first4=Patrick|last5=Rajbhandari|first5=Samyam|last6=Casper|first6=Jared|last7=Liu|first7=Zhun|last8=Prabhumoye|first8=Shrimai|last9=Zerveas|first9=George|last10=Korthikanti|first10=Vijay|last11=Zhang|first11=Elton|date=2022-02-04|title=Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model|url=http://arxiv.org/abs/2201.11990|journal=arXiv:2201.11990 [cs]}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* BigScience Large Open-Science (BLOOM) מודל שפה רב-לשונית פתוחה בגישה פתוחה עם 176 מיליארד פרמטרים.&lt;br /&gt;
* Transformer 2 עם 1.5 מיליארד פרמטרים.&lt;br /&gt;
* [[GPT-3]]: Generative Pre-trained Transformer 3, עם גודל חסר תקדים של הקשר באורך 2048 אורך סמלי ו-175 מיליארד פרמטרים (דורש 800 GB של אחסון).&lt;br /&gt;
* GPT-3.5/ [[ChatGPT]] /InstructGPT וגרסאות מתקדמות יותר מ-OpenAI&amp;lt;ref&amp;gt;{{Cite web|date=2022-11-30|title=ChatGPT: Optimizing Language Models for Dialogue|url=https://openai.com/blog/chatgpt/|access-date=2022-12-05|website=OpenAI|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* GPT-NeoX-20B: מודל שפה [[מודל אוטו-רגרסיבי|אוטורגרסיבית]] בקוד פתוח עם 20 מיליארד פרמטרים.&lt;br /&gt;
* OPT-175B מאת Meta AI: מודל נוסף של שפה של 175 מיליארד פרמטרים. זה זמין לקהילת המחקר הרחבה יותר של AI.&lt;br /&gt;
&lt;br /&gt;
[[בינה מלאכותית יוצרת|מודלים יוצרים]] שאינם מודל שפה:&lt;br /&gt;
&lt;br /&gt;
* יצירת תמונה תלת-ממדית של DreamFusion/Imagen מ-Google Research&amp;lt;ref&amp;gt;{{Cite web|last=Poole|first=Ben|last2=Jain|first2=Ajay|last3=Barron|first3=Jonathan T.|last4=Mildenhall|first4=Ben|date=2022|title=DreamFusion: Text-to-3D using 2D Diffusion|url=https://dreamfusion3d.github.io/|access-date=2022-12-05}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* Get3D מ-Nvidia&amp;lt;ref&amp;gt;{{Cite web|last=Gao|first=Jun|last2=Shen|first2=Tianchang|last3=Zian|first3=Wang|last4=Chen|first4=Wenzheng|last5=Yin|first5=Kangxue|last6=Li|first6=Diaqing|last7=Litany|first7=Or|last8=Gojcic|first8=Zan|last9=Fidler|first9=Sanja|date=2022|title=GET3D: A Generative Model of High Quality 3D Textured Shapes Learned from Images|url=https://nv-tlabs.github.io/GET3D/assets/paper.pdf|access-date=2022-12-05|website=nv-tlabs.github.io}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* MineClip מ-Nvidia&amp;lt;ref&amp;gt;{{Cite journal|last=Fan|first=Linxi|last2=Wang|first2=Guanzhi|last3=Jiang|first3=Yunfan|last4=Mandlekar|first4=Ajay|last5=Yang|first5=Yuncong|last6=Zhu|first6=Haoyi|last7=Tang|first7=Andrew|last8=Huang|first8=De-An|last9=Zhu|first9=Yuke|last10=Anandkumar|first10=Anima|date=2022-06-17|title=MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge|url=https://arxiv.org/abs/2206.08853v2|language=en|doi=10.48550/arXiv.2206.08853}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* Point-E מאת OpenAI: מחולל מודלים תלת־ממדיים.&amp;lt;ref&amp;gt;{{Cite web|last=Wiggers|first=Kyle|date=2022-12-20|title=OpenAI releases Point-E, an AI that generates 3D models|url=https://techcrunch.com/2022/12/20/openai-releases-point-e-an-ai-that-generates-3d-models/|access-date=2022-12-25|website=TechCrunch|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[Hugging Face]] מארח קבוצה של דגמי שפה זמינים לציבור עבור מפתחים לבניית יישומים באמצעות [[למידת מכונה]].&lt;br /&gt;
&lt;br /&gt;
== הערכת איכות של מודלים ==&lt;br /&gt;
הערכת האיכות של מודלי שפה נעשית בעיקר על ידי השוואה לאמות מידה מדגמיות שנוצרו על ידי אדם במשימות אופייניות למטרה הנמדדת.&lt;br /&gt;
&lt;br /&gt;
מבחני איכות נוספים בודקים את האופי הפנימי של מודל שפה או משווים שני מודלים אחד לשני. מכיוון שמודלי שפה נועדו בדרך כלל להיות דינמיים וללמוד מנתונים שהם רואים, כמה מודלים מוצעים חוקרים את קצב הלמידה, למשל באמצעות בדיקה של עקומות הלמידה של המודלים.&amp;lt;ref&amp;gt;{{Citation|last=Karlgren|first=Jussi|last2=Schutze|first2=Hinrich|chapter=Evaluating Learning Language Representations|date=2015|pages=254–260|publisher=Springer International Publishing|isbn=9783319642055|doi=10.1007/978-3-319-64206-2_8|title=International Conference of the Cross-Language Evaluation Forum|series=Lecture Notes in Computer Science}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
מערכי נתונים שונים פותחו לשימוש כדי להעריך מערכות עיבוד שפה:&lt;br /&gt;
* קורפוס של קבילות לשונית&amp;lt;ref&amp;gt;{{Cite web|title=The Corpus of Linguistic Acceptability (CoLA)|url=https://nyu-mll.github.io/CoLA/|access-date=2019-02-25|website=nyu-mll.github.io}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* מדד GLUE&amp;lt;ref&amp;gt;{{Cite web|title=GLUE Benchmark|url=https://gluebenchmark.com/|access-date=2019-02-25|website=gluebenchmark.com|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* קורפוס הפרפראזה של מיקרוסופט&amp;lt;ref&amp;gt;{{Cite web|title=Microsoft Research Paraphrase Corpus|url=https://www.microsoft.com/en-us/download/details.aspx?id=52398|access-date=2019-02-25|website=Microsoft Download Center|language=en-us}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* הסקת שפה טבעית רב-ז&amp;#039;אנרית&lt;br /&gt;
* שאלה בהסקת שפה טבעית&lt;br /&gt;
* צמדי שאלות Quora&amp;lt;ref&amp;gt;{{Citation|last=Aghaebrahimian|first=Ahmad|chapter=Quora Question Answer Dataset|date=2017|pages=66–73|publisher=Springer International Publishing|isbn=9783319642055|doi=10.1007/978-3-319-64206-2_8|title=Text, Speech, and Dialogue|volume=10415|series=Lecture Notes in Computer Science}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* זיהוי מעורבות טקסטואלית&amp;lt;ref&amp;gt;{{Cite web|last=Sammons, V.G.Vinod Vydiswaran, Dan Roth|first=Mark|last2=Vydiswaran|first2=V.G.|last3=Roth|first3=Dan|title=Recognizing Textual Entailment|url=http://l2r.cs.uiuc.edu/~danr/Teaching/CS546-12/TeChapter.pdf|access-date=February 24, 2019}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* מדד דמיון טקסטואלי סמנטי&lt;br /&gt;
* מבחן תשובה לשאלות SQuAD&amp;lt;ref&amp;gt;{{Cite web|title=The Stanford Question Answering Dataset|url=https://rajpurkar.github.io/SQuAD-explorer/|access-date=2019-02-25|website=rajpurkar.github.io}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* Stanford Sentiment Treebank &amp;lt;ref&amp;gt;{{Cite web|title=Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank|url=https://nlp.stanford.edu/sentiment/treebank.html|access-date=2019-02-25|website=nlp.stanford.edu}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
* וינוגרד NLI&lt;br /&gt;
&lt;br /&gt;
== ביקורת ==&lt;br /&gt;
למרות שניתן להראות שמודלי שפה בזמננו, דוגמת GPT-2, יכולים לבצע פעולות אנושיות בכמה סוגי משימות, לא הוכח עדיין שהם מודלים קוגניטיביים סבירים. לדוגמה, הוכח שרשתות עצביות חוזרות על דפוסים שבני אדם לא יוצרים באופן טבעי, ואינם מצליחים ללמוד דפוסים רבים שבני אדם כן לומדים.&amp;lt;ref&amp;gt;{{Cite book|last=Hornstein|first=Norbert|url=https://books.google.com/books?id=XoxsDwAAQBAJ&amp;amp;dq=adger+%22goldilocks%22&amp;amp;pg=PA153|title=Syntactic Structures after 60 Years: The Impact of the Chomskyan Revolution in Linguistics|last2=Lasnik|first2=Howard|last3=Patel-Grosz|first3=Pritty|last4=Yang|first4=Charles|date=2018-01-09|publisher=Walter de Gruyter GmbH &amp;amp; Co KG|isbn=978-1-5015-0692-5|language=en}}&amp;lt;/ref&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== קישורים חיצוניים ==&lt;br /&gt;
* [https://www.ai-blog.co.il/2022/10/16/בחירה-נכונה-של-מודל-שפה/ בחירה נכונה של מודל שפה], באתר ai-blog&lt;br /&gt;
&lt;br /&gt;
== הערות שוליים ==&lt;br /&gt;
{{הערות שוליים|יישור=שמאל}}&lt;br /&gt;
&lt;br /&gt;
{{בינה מלאכותית}}&lt;br /&gt;
&lt;br /&gt;
{{בקרת זהויות}}&lt;br /&gt;
&lt;br /&gt;
[[קטגוריה:מודלים מרקוביים]]&lt;br /&gt;
[[קטגוריה:בינה מלאכותית]]&lt;/div&gt;</summary>
		<author><name>imported&gt;Gili GanL</name></author>
	</entry>
</feed>