הארה קטנה בקשר ל-AI וזיהוי פנים
הרב ד"ר מיכאל אברהם שלום וברכה,
כמעריץ (בד"כ מרחוק 🙂 ) שלך ושל הגותך מזה יותר מ 20 שנה,
ארשה לעצמי להעיר/להאיר בקצרה על השיעור האחרון של בינה מלאכותית מס' 15.
צפיתי בכל הסדרה המרתקת ומצפה לשיעורים הבאים.
בכל אופן כמי שמצוי בתחום פיתוח ואימון מודלי AI במיוחד בתחום זיהוי פנים – ההסבר שהשמעת בשיעור לא היה מדויק, או על כל פנים לא הבנתי את ההסבר בצורה נכונה.
זיהוי פנים – לא עובד בתור איזשהו קסם פלאי / "טביעת עין" של מכונה, אלא קודם כל ע"י פירוק לגורמים של תמונת הפנים (בשכבה הראשונה מופעלים אלגוריתמים בסיסיים של ניתוח תמונה שיודעים לזהות דפוסים של פיקסלים, גבולות, קצוות, צבעים , אזורים משמעותיים וכדו' בשכבה הבאה הבנויה על גביה – הדפוסים האלה מתורגמים גם לחלקי ואיברי הפנים, כמו מיקום וגודל האף / עיניים / גבות / סנטר וכמו כן למבנה הפנים וגם לאזורים כלליים בפנים וכו' באימון עצמו כמובן לא מגדירים מראש אילו פרמטרים הם חשובים יותר או חשובים פחות ובכלל מהם הפרמטרים – אלא המשקלים מתעדכנים בצורה אוטומטית במהלך האימון על מיליונים רבים של תמונות.
המשקלים בסוף, כן יהיו מבוססים בעיקר על האיברים עצמם וצורת הפנים, חלק מהפרמטרים יכולים להיות יותר טריוויאלים כמו המרחק בין העיניים, אבל יכול להיות שייתגלו דברים ממש לא אינטואיטיביים כמו היחס בין גודל הסנטר לגודל עין ימין, או הזווית שבין האוזן לבין האף או צורה כללית של מבנה ראש, צורה גיאומטרית של אזור המצח וכו' וכו'
ולכן מאוד קשה בכלל ליצור אלגוריתם סטנדרטי של זיהוי ברמה גבוהה אלא רק ע"י רשת נוירונים, כי גם אנחנו בעצמנו לא יודעים איך אנחנו מזהים בני אדם – אז ברור שיהיה קשה להגדיר למכונה, גם אנחנו כנראה למדנו בצורה לא מודעת לאזן את המשקלים שלנו ע"י דוגמאות (מסתבר שכך זה עובד ברמה כזו או אחרת גם אצלנו, ע"ע: "כל הסינים נראים אותו דבר" – שזה תקף רק עבור מי שלא גדל בסין, מי שכן גדל שם לומד לתת משקל בצורה אחרת ומבדיל מצויין בין סיני אחד לרעהו).
גם את המושג טביעת עין של תלמיד חכם, אני מבין באופן דומה, ברור שמה שיוצר אצלו את ההרגשה/טביעת עין שהאבידה שייכת לו הוא הצירוף של הסימנים הפיזיים על גבי החפץ – אבל הוא איננו יכול לפרוט לפרוטות את הסימנים הבודדים שבסוף יוצרים אצלו את תחושת האימות, כי זה קורה אצלו באופן בלתי מודע.
עוד מילה אחת, זה נכון שקשה עד בלתי אפשרי להגדיר את המשקלים מראש אבל אחרי שהרשת כבר מאומנת, הפלט המתקבל על ידה (מה שנקרא אמבדינג וקטור), כן מכיל מידע משמעותי ואובייקטיבי ולכן ניתן למשל להפיק ממנו תמונת פנים הדומה לתמונה המקורית, ראה למשל כאן:
https://arxiv.org/html/2411.03960v1
תודה על כל השיעורים, הספרים והפעילות המבורכת שלך,
לגלות עוד מהאתר הרב מיכאל אברהם
Subscribe to get the latest posts sent to your email.
שלום.
תודה על מילותיך החמות.
באשר לזיהוי פנים, אני יודע שניתן לאמן אותו לזהות פנים בלי פירוק של המשימה. פשוט על ידי אימון מבוקר לפי דוגמאות מתויגות. וידאתי כעת גם עם גיפיטי והוא אישר זאת. כמובן שאיני מתמצא במה שקורה בפועל, ואולי כדי להגיע לרמת אמינות גבוהה צריך להיעזר בעוד דברים. בכל אופן, גם אם אתה צודק זה לא משנה עקרונית את התיאור של למידת רשת כסוג של 'נס'. אז תתייחס לזיהוי פנים ברמה הנמוכה שמושגת על ידי למידה מדוגמאות מתויגות בלבד.
השאלה האם אפשר להלבין את הקופסה, כלומר לנסות ולחלץ ממעגלים פנימיים כלשהם ברשת מרכיבים שונים של הפנים, או אפילו תמונה שלהם, זו שאלה אחרת (אני יודע שבאנתרופיק עוסקים הרבה בהלבנת הקופסה).
לגבי טביעות עין, דומני שהעליתי את שתי האפשרויות.
לגלות עוד מהאתר הרב מיכאל אברהם
Subscribe to get the latest posts sent to your email.
תודה רבה על תשובתך.
בדקתי שוב, ואתה צודק בשני דברים:
א. העלית בשיעור את שתי האפשרויות לגבי טביעת עין – גם את האפשרות שיש ניתוח פרטני של סימנים, שלא מתבצע במודע.
ב. ברשת נוירונים – המיפוי של איברים / אזורים בפנים אינו תנאי הכרחי לאימון הרשת. (אם כי כמעט כל הרשתות משתמשות בזה כתהליך מקדים לשפר את התוצאות)
אני רק אומר טענה פשוטה – גם אם לא מגדירים את האיברים מראש, זה לא אומר שהרשת עובדת בצורה אינטואיטיבית או הוליסטית (= "נס") אלא שהרשת לומדת לפרק ולנתח בעצמה את הפרמטרים המשמעותיים בתמונה (= בד"כ האיברים, כמובן לא רק) ולכוונן את המשקלים שלהם.
הסיבה שאני לא יכול לבנות אלגוריתם שיעשה את זה מראש, היא שאני לא יודע באמת את השיטה ועל סמך אילו פרמטרים (ואיזה משקל לתת לכל אחד כדי לאפשר) לזהות ולקטלג פנים (יכול להיות שאם הייתי מודע באופן מלא לצורה שבה אני בתור אדם יודע לעשות את זה – כן היה אפשרי) , בכל מקרה אחרי שהרשת כבר התאמנה ואני יודע את הפרמטרים והמשקלים אז אני כן יכול לבנות אלגוריתם סטנדרטי שיעשה את זה. (מה שבעצם יהווה חיקוי מדויק לדרך שבה הרשת עובדת) , בהקשר זה הבאתי את השיטות שמראות שניתן לעשות את התהליך ההפוך: להגיע חזרה מהפלט של הרשת לתמונה – מה שמוכיח שיש שם מידע אובייקטיבי ולא סוג של אינטואיציה הוליסטית לא ניתנת למדידה.
בשו"ט,
שלום.
כאן אתה נכנס לסוגיית הלבנת הקופסה שהתייחסתי אליה בדבריי. אתה מניח שאופן הפעולה של הרשת דומה למה שקורה אצלנו (כלומר שאם היינו יודעים יכולנו למצוא בתוכה מעגלים פנימיים שעושים את העבודה לפי חלקי הפנים. אנחנו רק לא יודעים מה לחפש). אני בכלל לא בטוח בזה, אבל גם אם זה קורה זו תוצאה של פעולה הוליסטית כי האימון בדוגמאות לא נותן להם מידע נפרד על מרחק העיניים או צורת האף אלא תגית של נכון או לא נכון לגבי כל תמונה בכללותה.
אגב, גם בצורת העבודה בפועל כפי שתיארת, לא הרשתות משתמשות במיפוי הפנים אלא הכלים שסביב הרשת עושים זאת. הרשת עצמה בהגדרה עושה עבודה הוליסטית.
השאר תגובה
Please login or Register to submit your answer