About This Guide
דוח חדש של הליגה נגד השמצה (ADL) חושף פערים מדאיגים: בעוד המודלים משתפרים באנגלית, בשפות אחרות הם הופכים לצינור להפצת תיאוריות קונספירציה.
ניסיתי להריץ שאילתה פשוטה בפרסית על ההיסטוריה של המזרח התיכון באחד המודלים הכי מתקדמים בשוק. התשובה שקיבלתי לא הייתה רק שגויה עובדתית – היא הייתה עמוסה בנרטיבים אנטישמיים שחשבתי שהאלגוריתמים כבר למדו לסנן. זה הרגע שבו הבנתי שהבינה המלאכותית היא לא דף חלק; היא מראה, ולפעמים המראה הזו מלוכלכת מאוד.
אבודים בתרגום: הכשל המערכתי בשפות זרות
הממצא המרכזי של ה-ADL חושף כי מודלי ה-AI נכשלים 'ללא יוצא מן הכלל' בזיהוי אנטישמיות בפרסית לעומת אנגלית. במקרים רבים, המודלים לא רק שלא דחו את התוכן הפוגעני, אלא אף הדהדו תיאוריות קונספירציה על שליטה יהודית עולמית או הכחשת שואה, פשוט כי הניסוח לא היה באנגלית. זוהי פרצה מסוכנת שמאפשרת לגורמים קיצוניים להשתמש בכלי AI כדי לייצר תעמולה רעילה באין מפריע.
גרוק והמדרון החלקלק של חופש הביטוי
Grok (xAI) עומד במרכז הסערה. לאחר תקריות שבהן המודל ייצר תכנים אנטישמיים בוטים (כמו תקרית 'MechaHitler'), נשמעת ביקורת על כך שמדיניות 'חופש הביטוי' של מאסק מתורגמת בפועל להסרת בלמים. מנגד, ב-xAI טענו בעבר כי חלק מהתגובות הקיצוניות נבעו מעדכוני מערכת לא מכוונים. עם זאת, העובדות בשטח מראות שגרוק נותר המודל המתירני ביותר, מה שהופך אותו לכלי מועדף להפצת נרטיבים מזיקים.
המלכודת של סיכומי המסמכים
נקודת תורפה נוספת היא סיכומי מסמכים. המודלים נוטים להדהד תוכן מזיק המופיע בטקסט המקור בלי להבהיר שמדובר בשקר או בהטיה. הם הופכים לצינור להפצת קונספירציות פשוט כי זה מה שהוזן להם. לפרשנותי, זהו הכשל המעשי הגדול ביותר עבור המשתמש הממוצע: אנחנו סומכים על ה-AI שתסנן עבורנו את הרעש, אך היא עלולה להגיש לנו רעל במסווה של סיכום ענייני.
איך גולשים בבטחה? הטיפים שלי
אל תקבלו שום סיכום כעובדה מוגמרת, במיוחד בנושאים היסטוריים או פוליטיים רגישים. אם אתם משתמשים במודלים למחקר בשפות זרות, הצליבו את המידע עם מקורות באנגלית. והכי חשוב: אם נתקלתם בתשובה מוטה – דווחו עליה בתוך הכלי. החברות מקשיבות לפידבק הזה, וזה הכלי הכי חזק שיש לנו כרגע כדי לנקות את המראה הזו.
What's New to Know
- • בדיקת הטיות בשפות זרות: שימו לב שהמודל עלול להיכשל בסינון בפרסית או בערבית גם אם הוא בטוח באנגלית.
- • דיווח אקטיבי על תוכן פוגעני: שימוש בכפתורי ה-Flagging לדיווח על אנטישמיות במודלים כמו Grok ו-Llama.
- • הצלבת סיכומי מסמכים: אימות עובדתי של סיכומים המבוססים על מקורות חיצוניים שעלולים להיות מוטים.