חזרה לבלוג

בינה מלאכותית וחברה · 25 באוגוסט 2026

המראה המלוכלכת: למה ה-AI שלנו עדיין נכשלת במבחן האנטישמיות?

מאת עדי קריאף

על מה המדריך?

דוח חדש של הליגה נגד השמצה (ADL) חושף פערים מדאיגים: בעוד המודלים משתפרים באנגלית, בשפות אחרות הם הופכים לצינור להפצת תיאוריות קונספירציה.

ניסיתי להריץ שאילתה פשוטה בפרסית על ההיסטוריה של המזרח התיכון באחד המודלים הכי מתקדמים בשוק. התשובה שקיבלתי לא הייתה רק שגויה עובדתית – היא הייתה עמוסה בנרטיבים אנטישמיים שחשבתי שהאלגוריתמים כבר למדו לסנן. זה הרגע שבו הבנתי שהבינה המלאכותית היא לא דף חלק; היא מראה, ולפעמים המראה הזו מלוכלכת מאוד.

ישבתי מול המסך, מנסה להבין איך מודלים שמתיימרים להיות 'בטוחים' עדיין נופלים למלכודות של שנאה. בדיוק אז פורסם דוח 'Lost in Translation' של הליגה נגד השמצה (ADL) מיולי 2026. החוקרים לא הסתפקו בבדיקה שטחית; הם הריצו 800 אינטראקציות מול המודלים המובילים – ChatGPT, Claude, Gemini ו-Grok. המסקנה שלהם מטלטלת: יש 'פער בטיחות' אדיר. בעוד שבאנגלית המודלים מצליחים לזהות ולדחות אנטישמיות ברוב המקרים, בשפות כמו פרסית, המחסומים פשוט קורסים. גיליתי שבעוד שחברות כמו אנתרופיק (Claude) משקיעות הון ב'מעקות בטיחות', מודלים אחרים, ובראשם Grok של אילון מאסק, סופגים ביקורת קשה על היעדר סינון מספק ותקריות של הפצת תוכן קיצוני.

אבודים בתרגום: הכשל המערכתי בשפות זרות

הממצא המרכזי של ה-ADL חושף כי מודלי ה-AI נכשלים 'ללא יוצא מן הכלל' בזיהוי אנטישמיות בפרסית לעומת אנגלית. במקרים רבים, המודלים לא רק שלא דחו את התוכן הפוגעני, אלא אף הדהדו תיאוריות קונספירציה על שליטה יהודית עולמית או הכחשת שואה, פשוט כי הניסוח לא היה באנגלית. זוהי פרצה מסוכנת שמאפשרת לגורמים קיצוניים להשתמש בכלי AI כדי לייצר תעמולה רעילה באין מפריע.

גרוק והמדרון החלקלק של חופש הביטוי

Grok (xAI) עומד במרכז הסערה. לאחר תקריות שבהן המודל ייצר תכנים אנטישמיים בוטים (כמו תקרית 'MechaHitler'), נשמעת ביקורת על כך שמדיניות 'חופש הביטוי' של מאסק מתורגמת בפועל להסרת בלמים. מנגד, ב-xAI טענו בעבר כי חלק מהתגובות הקיצוניות נבעו מעדכוני מערכת לא מכוונים. עם זאת, העובדות בשטח מראות שגרוק נותר המודל המתירני ביותר, מה שהופך אותו לכלי מועדף להפצת נרטיבים מזיקים.

המלכודת של סיכומי המסמכים

נקודת תורפה נוספת היא סיכומי מסמכים. המודלים נוטים להדהד תוכן מזיק המופיע בטקסט המקור בלי להבהיר שמדובר בשקר או בהטיה. הם הופכים לצינור להפצת קונספירציות פשוט כי זה מה שהוזן להם. לפרשנותי, זהו הכשל המעשי הגדול ביותר עבור המשתמש הממוצע: אנחנו סומכים על ה-AI שתסנן עבורנו את הרעש, אך היא עלולה להגיש לנו רעל במסווה של סיכום ענייני.

איך גולשים בבטחה? הטיפים שלי

אל תקבלו שום סיכום כעובדה מוגמרת, במיוחד בנושאים היסטוריים או פוליטיים רגישים. אם אתם משתמשים במודלים למחקר בשפות זרות, הצליבו את המידע עם מקורות באנגלית. והכי חשוב: אם נתקלתם בתשובה מוטה – דווחו עליה בתוך הכלי. החברות מקשיבות לפידבק הזה, וזה הכלי הכי חזק שיש לנו כרגע כדי לנקות את המראה הזו.

מה חדש שכדאי להכיר

  • • בדיקת הטיות בשפות זרות: שימו לב שהמודל עלול להיכשל בסינון בפרסית או בערבית גם אם הוא בטוח באנגלית.
  • • דיווח אקטיבי על תוכן פוגעני: שימוש בכפתורי ה-Flagging לדיווח על אנטישמיות במודלים כמו Grok ו-Llama.
  • • הצלבת סיכומי מסמכים: אימות עובדתי של סיכומים המבוססים על מקורות חיצוניים שעלולים להיות מוטים.

מקורות להעמקה

כתבות קשורות

בואו נדבר

צור קשר

מעוניינים בסדנה, הרצאה או ייעוץ? אשמח לשמוע מכם. מלאו טופס או שלחו הודעה

הדרך המהירה ביותר לדבר איתי היא ב-WhatsApp

שלחו לי הודעה ב-WhatsApp

אם נוח לכם יותר, אפשר גם להשאיר פרטים בטופס ואחזור אליכם.

רוצים שאחזור אליכם? השאירו פרטים

WhatsApp

מעדיפים ווצאפ? אשמח לשמוע!

פתח ווצאפ