למה לשאול שלושה מודלים ולא אחד?
תשובה של AI יכולה להישמע בטוחה לגמרי ועדיין להיות שגויה. כשיש לכם תשובה אחת, אין לכם במה להשוות אותה. כששלושה מודלים של שלוש חברות שונות עונים על אותה שאלה, רואים מיד איפה הם מסכימים ואיפה הדרכים נפרדות, ושם בדיוק כדאי לעצור ולבדוק.
ולמה שלושה ולא שניים? כששני מודלים חלוקים, נשארתם עם תיקו. כששלושה עונים, רואים אם אחד מהם יוצא דופן, או שכל אחד הולך לכיוון אחר. גם רוב של שניים מול אחד אינו הוכחה, אבל הוא מראה לכם בדיוק איזו טענה לבדוק קודם.
זה הרעיון של צ׳אט 3: שאלה אחת. שלושה מוחות. במצב שלושתם יחד השאלה נשלחת בבת אחת ל-ChatGPT של OpenAI, ל-Gemini של Google ול-Claude של Anthropic, ובמקום להסתמך על מוח AI אחד, מקבלים שלוש תשובות במסך אחד.
ChatGPT, Gemini ו-Claude: ההבדלים בקצרה
| מנוע | הושק | מה מציינים לרוב |
|---|---|---|
| ChatGPT | 30 בנובמבר 2022 | כלי כללי לכל משימה, פופולרי מאוד |
| Gemini | מרץ 2023, בשם Bard | ידע כללי רחב, קשר לעולם של Google |
| Claude | מרץ 2023 | כתיבה ארוכה וטון זהיר |
מאחורי כל מנוע עומדת חברה אחרת. OpenAI, שמפתחת את ChatGPT, נוסדה ב-2015 בסן פרנסיסקו. את Gemini מפתחת Google DeepMind, ובאפליקציה של Google הוא משתלב עם Gmail, Docs ו-Maps (בצ׳אט 3 הוא עובד בלעדיהם). את Anthropic, החברה שמאחורי Claude, הקימו ב-2021 אנשים שיצאו מ-OpenAI, והיא שמה דגש מיוחד על בטיחות AI.
כל השלושה מטפלים בעברית היטב, ומה שמבדיל ביניהם משתנה לפי סוג השאלה ולפי הגרסה. בצ׳אט 3 עונים בדרך כלל המודלים המהירים והחסכוניים של שלוש החברות, כך שההשוואה מראה בעיקר מה הם יודעים. המודלים החזקים ביותר שלהן עשויים לענות אחרת. להשוואה מעמיקה של כל זוג יש עמוד נפרד: ChatGPT מול Gemini, ChatGPT מול Claude ו-Gemini מול Claude.
איך נוצרת התשובה המשולבת, ומה הגבולות שלה
אחרי ששלושת המנועים עונים, צ׳אט 3 כותב תשובה משולבת אחת על בסיס שלוש התשובות. את הכתיבה עושה מודל של אחת משלוש החברות (כרגע Anthropic), שמקבל את התשובות בלי שמות ובסדר אקראי, כדי שלא יעדיף מותג. יחד איתה תראו עוד שלושה דברים: רמת ההסכמה בין המודלים, הנקודות שבהן הם חלוקים, והטענות שכדאי לבדוק. כך אפשר להבין את התמונה בלי לקרוא שלוש תשובות ארוכות מתחילתן ועד סופן.
לתשובה המשולבת יש גבולות, וכדאי להכיר אותם:
- היא נשענת על מה שהמנועים כתבו. אם שלושתם טועים באותה נקודה, גם היא עלולה לטעות.
- מקורות חיצוניים לא נבדקים בה, ובהיעדר גלישה חיה, מידע מהזמן האחרון עלול לחסור בה.
- כמו כל סיכום, היא מקצרת. כשמסומנת מחלוקת, שווה לפתוח את התשובות המקוריות ולראות מה כל מודל אמר בדיוק.
מתי כדאי לשאול את שלושתם, ומתי מנוע אחד מספיק
שלוש תשובות שוות את הזמן כשטעות עלולה לעלות לכם ביוקר:
- החלטות חשובות: בחירת מסלול לימודים, תכנון מעבר דירה, מכתב רגיש למעסיק. שלוש נקודות מבט עשויות לחשוף שיקול שתשובה אחת דילגה עליו.
- שאלות עמוסות בעובדות: תאריכים, שמות, מספרים והגדרות. כאן מחלוקת בין המודלים היא תמרור אזהרה ברור.
- טקסט שאתם רוצים ללטש: שלוש גרסאות לאותו מכתב הן חומר גלם, למשל מבנה מאחת, פתיחה מהשנייה ומשפט סיום מהשלישית.
- סיעור מוחות: שמות לעסק, רעיונות למתנה, כותרות. במקום רשימה אחת של רעיונות, מקבלים שלוש רשימות שונות לבחור מהן.
מנוע אחד מספיק כשהמשימה קטנה או קלה לבדיקה: תיקון ניסוח של משפט, תרגום קצר, או קוד שתריצו ממילא. יש גם שיקול מעשי. במגבלת השימוש היומית יש פחות השוואות מאשר הודעות למנוע אחד, אז כדאי לשמור אותן לשאלות שבאמת חשובות לכם.
דרך עבודה נוחה: התחילו עם מנוע אחד, ואם התשובה חשובה, לחצו על הכפתור שבודק את אותה שאלה מול שני האחרים. ואם תרצו, אפשר לעבור למנוע אחר תוך כדי שיחה, בלי לאבד את מה שכבר נכתב.
קיבלתם תשובה ממקום אחר, למשל מהאפליקציה של ChatGPT? תוכלו להדביק אותה בבדיקת תשובת AI, ושני המנועים האחרים יחוו עליה דעה. מדובר בדעה שנייה של מודלים, ובדיקה מול מקורות היא עדיין עבודה שלכם.
שאלות שכדאי לשאול את שלושתם
השאלות האלה מתאימות במיוחד לשלושה מודלים, כי יש בהן עובדות לבדיקה, החלטה לשקול או טקסט שאפשר לשפר. העתיקו אחת מהן לכלי שלמעלה:
- מה ההבדל בין שפעת להצטננות, ומתי כדאי לפנות לרופא? הסכמה בין שלושתם מעודדת, אבל רק רופא יכול לבדוק אתכם.
- אני מתלבט בין לימודי סיעוד ללימודי ריפוי בעיסוק. אילו שאלות כדאי לי לשאול את עצמי לפני שאחליט? אין כאן תשובה נכונה אחת, וההבדלים בין המודלים הם שיקולים שאולי לא חשבתם עליהם.
- מה המצב העדכני של הקו הסגול ברכבת הקלה בתל אביב? המנועים לא גולשים כאן ברשת, ולכן זו בדיקה טובה: מי מודה שהמידע שלו עלול להיות ישן.
- מה ההבדל בין חוק לתקנה בישראל, ומי מוסמך לקבוע כל אחד מהם? עובדות אזרחיות שאפשר לאמת. אם אחד המודלים עונה אחרת, בדקו את הנקודה במקור רשמי, ואל תניחו שהרוב צודק.
- תשפר את הפסקה הזאת בלי לשנות את הסגנון שלי: [הדביקו פסקה משלכם] תקבלו שלושה עיבודים שונים, ומכל אחד אפשר לקחת את מה שעובד.
- תציע חמישה שמות לפודקאסט על ההיסטוריה של באר שבע, ולכל שם משפט שמסביר אותו. סיעור מוחות: חמש עשרה הצעות במקום חמש.
- לאבא ולבן יחד 36 שנים. בעוד 4 שנים, גיל האבא יהיה פי 3 מגיל הבן. בני כמה הם היום? יש פתרון אחד בלבד. אם אחד המנועים הגיע לתוצאה אחרת, תראו את זה מיד.
לפני שאתם מדביקים טקסט משלכם: כל שאלה עוברת לעיבוד אצל OpenAI, Google ו-Anthropic, אז מחקו מהטקסט קודם פרטים מזהים.
איך לקרוא תוצאה של שלושה מודלים
שלוש תשובות, תשובה משולבת ורמת הסכמה הן הרבה טקסט לקרוא בבת אחת. סדר הקריאה הזה חוסך זמן:
- רמת ההסכמה: היא אומרת לכם כמה זהירים להיות בהמשך.
- הנקודות שבמחלוקת: כאן נמצא העיקר. אם אחת מהן נוגעת לפרט שחשוב לכם, התחילו ממנה.
- הטענות שכדאי לבדוק: בחרו אחת או שתיים ובדקו אותן במקור חיצוני.
- התשובה המשולבת: אחרי שאתם יודעים איפה החולשות, קל יותר לקרוא אותה נכון.
- התשובות הנפרדות: כשצריך פרטים, ניסוח מסוים או את הנימוק המלא של מנוע אחד.
הסכמה גבוהה, הסכמה חלקית, המודלים חלוקים
כל שאלה לשלושתם מקבלת אחת משלוש רמות הסכמה. כך כדאי לפרש אותן:
| רמת ההסכמה | מה היא אומרת | מה לעשות |
|---|---|---|
| הסכמה גבוהה | שלושת המודלים הגיעו בעיקר לאותה תשובה | לקרוא את התשובה המשולבת ולבדוק את הטענות שסומנו |
| הסכמה חלקית | יש בסיס משותף, ויש פרטים שבהם התשובות נפרדות | לבדוק קודם את הפרטים השנויים במחלוקת |
| המודלים חלוקים | התשובות סותרות זו את זו | לקרוא את שלוש התשובות ולחפש מקור חיצוני |
הסכמה אינה הוכחה. גם כששלושת המודלים מסכימים, התשובה יכולה להיות שגויה, למשל כשמדובר במשהו שהשתנה לאחרונה. בשאלות רפואיות, משפטיות וכספיות, השתמשו בהשוואה כהכנה לפגישה עם בעל מקצוע מוסמך: רופא, עורכת דין או יועץ פיננסי.
ומחלוקת היא סימן שימושי. היא מסמנת לכם איפה תשובה אחת הייתה עלולה להטעות אתכם, ואת זה לא הייתם רואים אם הייתם שואלים רק מודל אחד.