סקירה מדעית ומדריך ארגוני ל-Synthetic Data: שימושים, איכות, פרטיות דיפרנציאלית, דליפת מידע, Model Collapse ופיילוט בטוח. נתונים סינתטיים הם רשומות, תמונות, טקסטים או תרחישים שנוצרו באופן מלאכותי כדי לשמר מאפיינים שימושיים של המציאות בלי להעתיק בהכרח אדם או אירוע אמיתי. הם יכולים לפתוח סביבת פיתוח, להרחיב מקרי קצה, לבדוק מערכת ולהפחית חשיפה של מידע רגיש. עם זאת, המילה סינתטי אינה תעודת פרטיות. מחולל יכול לשחזר רשומה נדירה, לשמר הטיה, להסתיר קבוצה קטנה או לייצר נתונים שנראים אמינים אך אינם מתאימים להחלטה. לכן יש להגדיר שימוש, למדוד תועלת ופרטיות בנפרד ולשמור נתוני אמת לבדיקת איכות.

המילה סינתטי אינה תעודת פרטיות. רק בדיקה מול תוקף ונתוני Holdout מאפשרת החלטה.
מהם נתונים סינתטיים ומה הם אינם
נתונים סינתטיים יכולים להיווצר באמצעות חוקים, סימולציה, מודל סטטיסטי או מודל גנרטיבי. סימולטור תנועה יכול ליצור מסלולי רכב; מערכת טבלאית יכולה לדגום לקוחות מלאכותיים; מודל שפה יכול לייצר פניות שירות; ומחולל תמונות יכול להוסיף תנאי תאורה נדירים. המשותף הוא שהדוגמה נוצרה לצורך מוגדר ולא נאספה ישירות כאירוע בעולם.
אין להסיק מכך שהנתונים אנונימיים, מאוזנים או נכונים. אם המודל למד ממאגר רגיש, הוא עלול לשמר מבנה שמאפשר הסקת חברות במאגר או להתקרב לרשומה מקורית. אם הסימולציה אינה משקפת את המציאות, המערכת תלמד עולם נקי מדי. נתונים סינתטיים הם מוצר נתונים שדורש חוזה איכות, מקור, גרסה ובעלים.
- יצירה מחוקים או סימולציה
- מודל סטטיסטי או גנרטיבי
- לא תחליף אוטומטי לאנונימיזציה
- לא הוכחה לייצוג המציאות
איפה נמצא הערך הארגוני
נקודת פתיחה טובה היא פיתוח ובדיקות. צוות יכול לבנות מסך, שאילתה או תהליך על נתונים שאינם שייכים ללקוח אמיתי, ורק לאחר מכן לעבור לסביבה מאובטחת. שימוש נוסף הוא יצירת מקרי קצה שקשה או מסוכן לאסוף, כמו תקלה נדירה, הונאה, ניסוח עוין או שילוב ערכים חריג. בהדרכת עובדים אפשר ליצור תיקים, שיחות וטפסים לתרגול בלי לחשוף אדם.
נתונים סינתטיים עשויים גם לסייע בהרחבת קבוצה קטנה או באיזון מחלקות, אך כאן הסיכון גבוה יותר. הגדלה מלאכותית אינה מוסיפה ידע שלא היה במקור ועלולה להעצים את ההנחות של המחולל. לפני שמשתמשים בהם לאימון או לקבלת החלטה, בודקים שהשיפור נשמר על Holdout אמיתי שלא שימש ליצירה.
- סביבת פיתוח והדגמה
- תרגול והדרכת עובדים
- בדיקות עומס ומקרי קצה
- השלמת נתונים תחת בקרה
ארבעה מדדים במקום ציון איכות אחד
Fidelity בודק אם התפלגויות וקשרים סטטיסטיים דומים למקור. Utility בודק אם הנתונים מועילים למשימה, למשל אם מודל שאומן עליהם עובד על נתוני אמת. Privacy בודק האם אפשר להסיק מידע על רשומה או אדם, ו-Fairness בודק אם קבוצות ומקרי שוליים מיוצגים באופן שאינו מעוות את התוצאה. ארבעת המדדים יכולים לנוע בכיוונים מנוגדים.
התאמה מושלמת להתפלגות המקור אינה תמיד רצויה, משום שהיא עלולה לשקף יתר על המידה דוגמאות נדירות. פרטיות חזקה יכולה להפחית תועלת. לכן מגדירים ספים לפי השימוש. נתונים לתצוגת ממשק אינם צריכים לשמר כל קשר מורכב; נתונים למחקר סטטיסטי דורשים נאמנות גבוהה יותר; ונתונים שמגיעים למערכת החלטה מחייבים גם בדיקת קבוצות, קצוות ותוצאות בעולם האמיתי.
- Fidelity - דמיון למקור
- Utility - ביצוע במשימת אמת
- Privacy - עמידות להסגרה
- Fairness - ייצוג ותוצאה
פרטיות דיפרנציאלית אינה כפתור קסם
Differential Privacy היא מסגרת מתמטית שמגבילה עד כמה השתתפות של רשומה יחידה יכולה לשנות את הפלט. בהקשר של נתונים סינתטיים ניתן לאמן או להפעיל מחולל תחת תקציב פרטיות מוגדר. היא חזקה יותר מהבטחה כללית שהנתונים אינם אמיתיים, אך האיכות תלויה בפרמטרים, בחישוב התקציב, במימוש ובכל שאר שכבות המערכת.
ארגון צריך לבקש מהספק הסבר על יחידת ההגנה, epsilon ו-delta, Composition, מספר הרצות, טיפול בקבוצות קטנות והתקפות שנבדקו. גם כאשר קיימת ערובה פורמלית, נדרשים אבטחת גישה, מחיקה, הפרדת סביבות ובקרה על הפלט. אין לפרסם מאגר או לאשר שימוש רק משום שמופיעה המילה DP במצגת.
- יחידת פרטיות מוגדרת
- תקציב ו-Composition
- יישום ובדיקת תקיפה
- מעטפת אבטחה וממשל
כך בונים פיילוט בטוח
בוחרים מקרה שימוש אחד ומסווגים את רגישות המקור. מפרידים Train, Holdout ו-Audit לפני יצירת הנתונים. מגדירים תוצאה עסקית, שדות שאסור לשחזר וקבוצות שחייבות להישמר. מייצרים כמה גרסאות, מתעדים מודל ופרמטרים ומשווים כל אחת לנתוני אמת במרחב מאובטח.
לאחר בדיקות סטטיסטיות מריצים משימה אמיתית, בדיקות חברות ושחזור, בדיקת רשומות קרובות ומקרי קצה. מומחה תחום בוחן אם הנתונים נראים אפשריים, אך שיפוט חזותי אינו מחליף מדידה. הפצה מתחילה לקהל מצומצם ובמטרה מוגדרת. כל שימוש חדש דורש הערכה מחדש, משום שנתונים בטוחים להדגמה אינם בהכרח בטוחים למחקר או לאימון.
- הפרדת מקור, Holdout ו-Audit
- חוזה שימוש וסיכון
- מדדי תועלת ופרטיות
- הגבלת הפצה ושימוש חוזר
סקירה מדעית: איכות, שימושיות ופרטיות הן שלוש בדיקות שונות
NIST מציגה ב-SDNist וב-PETs Testbed גישה רב-ממדית להערכת נתונים סינתטיים. דמיון סטטיסטי בודק אם ההתפלגויות והקשרים נשמרו, שימושיות בודקת אם הנתונים תומכים במשימה, ופרטיות בודקת אם אפשר להסיק מידע על רשומות המקור. ציון טוב בממד אחד אינו מבטיח ציון טוב באחר.
המשמעות לארגון היא שאין מדד יחיד בשם איכות סינתטית. מאגר שמייצר גרפים דומים למקור עלול להיכשל במודל חיזוי, ומאגר שימושי למודל עלול לשמר אדם חריג. לכן מסמך הקבלה צריך לכלול לפחות השוואת התפלגויות, ביצוע במשימת יעד ומבחן תקיפה. את שלושתם מבצעים על נתוני Holdout שלא הוזנו למחולל.
- Fidelity מול מקור
- Utility במשימת יעד
- Privacy מול תוקף
- Holdout נפרד
35 טבלאות אמיתיות מראות שאין מחולל שמנצח תמיד
Byun ועמיתיו בחנו ב-2025 מחוללים סטטיסטיים, מודלים גנרטיביים ומודלי בסיס על 35 טבלאות ממאגרים אמיתיים. המחקר מדגיש את המתח בין פרטיות לשימושיות ואת התלות בהקשר: משפחת מודלים שנראתה חזקה במדדי איכות לא סיפקה בהכרח את הגנת הפרטיות הטובה ביותר. בתצורות שנבדקו, מודלי בסיס הציגו את סיכון הפרטיות הגבוה ביותר מבין המשפחות.
אין להסיק מכך שכל מודל שפה מסוכן או שמחולל סטטיסטי תמיד בטוח. התוצאה תלויה בנתונים, באימון, בפרמטרים ובמתקפה. הלקח היישומי הוא להשוות כמה חלופות באותו Harness, באותו תקציב פרטיות ובאותה משימת יעד. בחירה לפי דוגמה מרשימה או לפי שם הספק אינה בדיקת קבלה.
- 35 טבלאות אמיתיות
- אין מנצח אוניברסלי
- מתח פרטיות-שימושיות
- השוואה באותו Harness
Membership Inference ודליפה סמויה
Synth-MIA מציע מבחן Membership Inference שמנסה להעריך אם רשומה מסוימת הייתה חלק מנתוני האימון של המחולל. מחקר נוסף מ-2025 על דליפה סמויה מראה שמדדי מרחק גלובליים עלולים להחמיץ סיכון שנמצא באשכול קטן או בתת-אוכלוסייה נדירה. שני המחקרים הם Preprints, ולכן ראוי להתייחס אליהם ככיוון בדיקה עדכני ולא כתקן סופי.
בפיילוט מוסיפים Canary Records או רשומות קצה מבוקרות, מריצים כמה סוגי התקפה ובודקים קבוצות קטנות בנפרד. לא מפרסמים דוגמאות קרובות מדי לרשומת מקור ולא מניחים שהסרת שם ומספר זהות מספיקה. אם הנתונים מיועדים לצד שלישי, מגדירים גם מה אסור לנסות להסיק ומהו נוהל דיווח על חשד לדליפה.
- Membership Inference
- קבוצות קטנות וחריגים
- Canary Records
- Preprints שדורשים זהירות
פרטיות דיפרנציאלית היא הבטחה מתמטית עם הנחות
NIST SP 800-226 מסבירה כיצד להעריך טענות לפרטיות דיפרנציאלית ולא להסתפק בתווית DP. ההבטחה נמדדת באמצעות פרמטרים כמו epsilon ו-delta, אך תלויה גם ביחידת הפרטיות, בהרכב של כמה שאילתות, בדגימה, בחשבונאות הפרטיות ובמימוש התוכנה. מספר epsilon ללא תיאור המערכת אינו מאפשר להעריך את ההגנה.
לכן הארגון צריך לשמור Privacy Card: מי מוגן, מפני איזה תוקף, מהי יחידת הרשומה, מהו התקציב המצטבר ואילו פעולות צורכות אותו. DP יכולה להפחית סיכון, אך אינה מתקנת הרשאות חלשות, מקור מידע לא חוקי, שיתוף יתר או פלט מוטה. היא שכבה בתוך ממשל נתונים, לא תחליף לו.
- epsilon ו-delta
- יחידת פרטיות
- Composition ותקציב
- מימוש והרשאות
Model Collapse: סינתטי אינו תחליף קבוע למציאות
Shumailov ועמיתיו הראו ב-Nature שתהליך רקורסיבי שבו מודלים לומדים מפלט של מודלים עלול לאבד מידע על זנבות ההתפלגות ולהתכנס לייצוג מצומצם של המציאות. הבעיה אינה שכל שימוש בנתונים סינתטיים גורם מיד לקריסה, אלא שהחלפה חוזרת של המקור מוחקת בהדרגה אירועים נדירים ומגבירה שגיאות.
Kazdan ועמיתיו הראו בתרחישי מחקר שהצטברות נתונים אמיתיים לצד נתונים סינתטיים יכולה להתנהג אחרת מהחלפה מלאה. בפועל שומרים מקור, מסמנים Provenance, מחזיקים Golden Set אמיתי ומנטרים קבוצות קצה. נתונים סינתטיים משמשים להרחבה, בדיקה או גישה מבוקרת - לא הוכחה שהארגון יכול להפסיק לאסוף אמת איכותית.
- זנבות ההתפלגות
- החלפה לעומת הצטברות
- Provenance לכל דוגמה
- Golden Set אמיתי
מדריך יישומי: כך מתחילים עם נתונים סינתטיים ופרטיות
כדי להפוך את הקריאה לפעולה, בחרו יחידה אחת ומשימה אחת. תארו כיצד היא מתבצעת היום, מי מעורב, איזה מידע נדרש ומהי תוצאה טובה. לאחר מכן נסחו השערה קטנה: כיצד נתונים סינתטיים ופרטיות עשוי לשפר זמן, איכות, בהירות או למידה. הימנעו מיעד כללי כמו “להשתמש יותר ב-AI”; יעד שימושי מתאר התנהגות ותוצר שאפשר לראות.
בשלב הבא מומלץ להפריד מקור, Holdout ו-Audit, למדוד Utility ו-Privacy ולהגביל שימוש לפי מטרה. השתמשו רק בכלי ובמידע שאושרו, הגדירו קריטריונים לפני הפעלת הכלי ושמרו גרסה של התהליך הקיים. התייחסו לניסיון הראשון כאל פיילוט ללמידה. אם התוצאה חלשה, בדקו אם הבעיה נבעה מהגדרת משימה, מקור, הרשאה, תדריך, יכולת הכלי או בקרת האדם — ולא רק אם הפרומפט היה ארוך מספיק.
- משימה אחת וקהל מוגדר
- קו בסיס של זמן ואיכות
- כלי ומידע מאושרים
- קריטריונים ותיעוד
תכנית עבודה ל-30 יום
בשבוע הראשון ממפים את המשימה, אוספים שתי דוגמאות ומגדירים כללי מידע. בשבוע השני מקיימים הדרכה ותרגול מונחה, ובונים תבנית ראשונה. בשבוע השלישי המשתתפים מפעילים את השיטה בעבודה ומתעדים תוצאה, תיקון ושאלה. בשבוע הרביעי משווים לקו הבסיס, משתפים לקחים ומחליטים אם לשפר, להרחיב או לעצור.
הקצב חשוב יותר מהיקף התוכן. עדיף ניסוי קטן עם משוב מאשר קורס רחב שאין אחריו יישום. מנהל הקבוצה צריך להקצות זמן, להסיר חסם ולהבהיר שאין להסתיר טעויות. שגריר AI או מומחה מלווה מרכז שאלות חוזרות והופך אותן לחומר למידה. כך הידע שנוצר בפיילוט הופך לנכס ארגוני.
- שבוע 1 — מיפוי וקו בסיס
- שבוע 2 — הדרכה ותבנית
- שבוע 3 — יישום ומשוב
- שבוע 4 — מדידה והחלטה
שאלות ביקורת לפני שמרחיבים
לפני הרחבה שאלו האם המשתמשים יודעים להסביר מתי להשתמש ומתי לא, האם הם פותחים מקורות, מהי עלות התיקון והאם התהליך עובד גם בקלט שאינו מושלם. בדקו מי מרוויח מהשינוי, מי נושא בעומס חדש ומה קורה כאשר הכלי אינו זמין. שאלות אלה מונעות מצב שבו הדגמה מוצלחת הופכת במהירות לסטנדרט לא יציב.
לבסוף, ודאו שקיימים בעלים, מדד וקצב עדכון. AI משתנה במהירות, אך ארגון אינו יכול לשנות נורמות מדי יום. בנו עקרונות יציבים, רשימת כלים מתעדכנת וספריית תרחישים שעוברת בדיקה. הרחיבו רק כאשר אפשר לשחזר את התהליך, להדריך עובד חדש ולהסביר את ההחלטה לגורם מקצועי או ניהולי.
- אפשר להסביר ולשחזר
- המקורות וההרשאות ברורים
- עלות התיקון סבירה
- קיימים בעלים ומנגנון עדכון
להמשיך מהידע ליכולת
מה לקחת מכאן?
- נתונים סינתטיים יכולים להפחית חשיפה אך אינם אנונימיים מעצם שמם
- מודדים Fidelity, Utility, Privacy ו-Fairness בנפרד
- Holdout אמיתי ובדיקות תקיפה נדרשים לפני הרחבה
- שומרים מקור, גרסה ומטרת שימוש כדי למנוע זיהום והסקת יתר
המקורות שעליהם נשענת הסקירה
- NIST (2026), Privacy-Enhancing Technologies Testbed
- NIST, SDNist Synthetic Data Report Tool
- NIST SP 800-226 (2025), Guidelines for Evaluating Differential Privacy Guarantees
- Byun et al. (2025), Risk In Context: Benchmarking Privacy Leakage of Foundation Models in Synthetic Tabular Data Generation
- Ward et al. (2025, preprint), Synth-MIA: A Testbed for Auditing Privacy Leakage in Tabular Data Synthesis
- Mustaqim et al. (2025, preprint), When Privacy Isn't Synthetic: Hidden Data Leakage in Generative AI Models
- Shumailov et al. (Nature 2024), AI models collapse when trained on recursively generated data
- Kazdan et al. (2024), Collapse or Thrive? Perils and Promises of Synthetic Data in a Self-Generating World
- Sidorenko et al. (2025), A Comprehensive Evaluation Framework for Synthetic Tabular Data
המקורות נועדו להעמקה ואינם תחליף לייעוץ משפטי, מדעי או מקצועי המותאם לארגון.
רוצים להפוך את הידע לתכנית עבודה?
המכון הישראלי לבינה מלאכותית יבנה עבורכם הרצאת בינה מלאכותית, הרצאת AI, סדנה מעשית או סדרת 3–5 מפגשים שמותאמת לאנשים, לכלים ולמשימות בארגון.
למעבדת Use Cases ונתונים ארגונית