עיצוב הבדיקה

הגשנו ערכה זהה של 50 שאלות מחקר משפטי לשבע פלטפורמות AI משפטי: Harvey, Lexis+ AI, Thomson Reuters CoCounsel, Casetext, Spellbook, Westlaw Edge AI, ופריסת GPT-4 כללית עם פרומפט מערכת משפטי.

הזיה הוגדרה באופן רחב: כל ציטוט שאינו קיים, כל קביעה שמאפיינת שגויה תיק, כל טענה עובדתית שגויה מהותית, וכל מצב רגולטורי שאינו עדכני.

ממצאים מבניים

ממצא ראשון: AI משפטי מיוחד עולה דרמטית על AI כללי — כ-31% שיעור הזיות לפריסת GPT-4, לעומת 3-6% לפלטפורמות מיוחדות. ממצא שני: עדכניות היא דפוס הכישלון הנפוץ ביותר. ממצא שלישי: ביטחון הפלטפורמה אינו מנבא דיוק.

ההשלכה התפעולית

טווח ההזיות 3-31% אומר שפרוטוקול האימות המתאים משתנה דרמטית בהתאם לפלטפורמה. שיעור הזיות של 3% עשוי לתמוך בפרוטוקול אימות קל במחקר שגרתי. שיעור של 31% דורש אימות עצמאי של כל ציטוט.