בעיית העקיבה אחר כלל של ויטגנשטיין
שלום הרב, אני זה שהעלה את ההשגות על שיעור 15 בבינה מלאכותית. סליחה על העיכוב בתשובה, לא הייתי פנוי בגלל החגים. רציתי לחזור לנקודה אחת מהדיון שלנו אם אפשר ולהסביר את הטענה שלי בצורה מסודרת יותר.
בדיון הקודם טענתי שכישלונם של מודלי שפה בחיבור מספרים ארוכים אינו מעיד בהכרח על מגבלה עקרונית של רשתות נוירונים בלמידת כללים. ייתכן שריבוי הפרמטרים מאפשר לרשת למצוא פתרון מורכב, המבוסס על כללים רבים ומיותרים, שמתאים לדוגמאות האימון אך אינו מכליל היטב. לעומת זאת, אם נגביל את מורכבות הרשת ונמצא פתרון מינימלי שמתאים לנתוני האימון, נוכל עקרונית להגיע גם לכלל החיבור עצמו. זאת בשונה מהדוגמה שהבאתי לגבי DNA, שבה הנחנו שהמידע הדרוש להסקת הכלל כלל אינו נמצא בנתוני האימון.
בתגובה הרב העלה את בעיית העקיבה אחר כלל של ויטגנשטיין: לכל מספר סופי של דוגמאות קיימים אינספור כללים שמתאימים להן, ולכן אין דרך להסיק מהדוגמאות לבדן מהו הכלל הנכון (ולכן אפשר לומר שהרשת לא באמת יכולה להיכשל בהכללה, היא פשוט בוחרת הכללה שונה).
אני מסכים לחלוטין עם הטענה הזאת, אבל היא אינה שוללת את האפשרות ללמוד את הכלל הנכון באופן סטטיסטי. אפשר להמחיש זאת באמצעות הניסוי המחשבתי הבא.
נניח שקיים חוק אמיתי שמייצר את הנתונים, ושיש לנו אפשרות לדגום מאותו מקור עוד ועוד דוגמאות. מטרתנו היא לזהות את החוק מתוך מרחב ההיפותזות האפשריות. ההנחה היחידה לגבי החוק עצמו היא שאפשר לתאר אותו באמצעות מספר סופי של ביטים.
כעת נסדר את כל ההיפותזות לפי אורך התיאור שלהן, ובכל שלב נבחר את ההיפותזה בעלת התיאור הקצר ביותר שמתאימה לכל הדוגמאות שנאספו. מאחר שמספר ההיפותזות שניתן לתאר באמצעות מספר מוגבל של ביטים הוא סופי, גם מספר המועמדות שאינן מורכבות יותר מהחוק האמיתי הוא סופי.
לכל אחת מהמועמדות השגויות האלה, אם היא חולקת על החוק האמיתי בחלק בעל הסתברות חיובית מהנתונים, יש סיכוי חיובי להיפסל בכל דגימה חדשה. לכן, ככל שנמשיך לדגום, ההסתברות שהיא תשרוד את כל הדוגמאות תלך ותקטן עד לאפס. מכיוון שיש רק מספר סופי של מועמדות כאלה, בסופו של דבר כולן ייפסלו בהסתברות 1, ונישאר עם החוק האמיתי, או עם חוק שלא ניתן להבחין בינו לבין החוק האמיתי באמצעות הדגימות שלנו.
כלומר, אף שמכל אוסף סופי של דוגמאות אפשר לגזור אינספור כללים, העדפה שיטתית של היפותזות פשוטות מאפשרת, תחת ההנחות שתיארתי, התכנסות סטטיסטית לחוק האמיתי. זהו הרעיון העומד מאחורי עקרון אוקהם ותוצאות רלוונטיות בתורת הלמידה, ועל כן במקרה של חיבור מספרים, אלגוריתם למידה טוב יותר היה מביא לנו פתרונות פשוטים יותר המסבירים את התפלגות האינטרנט שהיו צפויים להכליל יותר טוב בכלל המקרים ובפרט עבור חיבור מספרים.
בקיצור, העדפת הפשטות אינה רק אינטואיציה אנושית לגבי מה שנראה לנו כלל טבעי. תחת ההנחה שהחוק האמיתי בעל תיאור סופי, אפשר להוכיח שבחירת ההיפותזה הקצרה ביותר שמתאימה לכל הדוגמאות תתכנס, בהסתברות 1, לחוק האמיתי, עד כדי הבדלים שאי אפשר לזהות בהתפלגות הדגימות. הסיבה היא שהגבלת אורך התיאור מצמצמת את המועמדות הרלוונטיות לקבוצה סופית, שכל השערה שגויה בה תיפסל בסופו של דבר. לכן יש להעדפת הפשטות הצדקה מתמטית שאינה תלויה בהבנה סמנטית של הכלל.
מקווה שלא עברתי ב"כי קאי רבי בהא מסכתא – לא תשייליה במסכתא אחריתי":)
לגלות עוד מהאתר הרב מיכאל אברהם
Subscribe to get the latest posts sent to your email.
Please login or Register to submit your answer