CodeariaAcademy
כריכת המאמר: כיתוב «מי בדק 722 עבודות» וחפץ שמראה את החלק הבדוק והחלק שלא נבדק בערימת כתבי יד
7 אוקטובר 20267 דק׳ קריאהסוכני AIClaude Code

722 עבודות מתמטיקה של מודל סגור של OpenAI. כמה מהן בדקה מכונה?

הסיכומים כותבים שההוכחות נבדקו ב-Lean, אבל קטלוג הפורמליזציות של OpenAI עצמה מסומן unchecked. השווינו את השחרור מ-6 באוקטובר למה שביקשו מתמטיקאי AGMAI.

במאמר הזה5
בקצרה

ב-6 באוקטובר 2026 OpenAI פרסמה במאגר openai/math 722 כתבי יד מתמטיים, מקובצים ב-372 משפחות תוצאות. מקורם במודל פנימי ללא שם: הוא קיבל כ-4,000 בעיות והשקיע בממוצע שלוש שעות חישוב ברמת ChatGPT Pro לכל תוצאה. בין הטענות: השערת רימן הכמעט-מלאה (אין אפסים לפונקציית זטא כאשר Re s > 7/8), החסם ω ≤ 9/4 לכפל מטריצות והשערת ברנט. לפי הספירה שלנו, ל-235 מתוך 372 המשפחות יש קישור ל-Lean, שבו תוכנה בודקת את ההוכחה. אבל קטלוג הפורמליזציות עצמו מסומן «Partial progress» ו-review: unchecked, וב-README כתוב שבתוצאות שלא עברו פורמליזציה עלולות להיות שגיאות. קבוצת היועצים המתמטיקאים AGMAI ביקשה ב-29 בספטמבר לפרסם לכל תוצאה את המודל, הפרומפטים, הנימוקים, הזמן והעלות. OpenAI מילאה את זה חלקית.

722 כתבי יד, 372 משפחות תוצאות, commit אחד בשם Initial commit. כך נראה ב-6 באוקטובר שחרור המתמטיקה של OpenAI: תוצרים של כמה שבועות עבודה של מודל פנימי נחתו במאגר פתוח ביום אחד. ב-21 בספטמבר החברה עוד דיברה על «יותר מ-100» בעיות פתוחות שנפתרו.

לפני חודש פירקנו איך נחיל של 10,000 סוכני OpenAI תקף את בעיית נאבייה-סטוקס, והסיפור האמיתי שם התברר כמאמת המכונה: Lean. השאלה לשחרור החדש זהה: איפה עמד המאמת, ואיפה הוא חסר.

מה OpenAI פרסמה ב-6 באוקטובר

לפי ה-README של המאגר, כמעט כל התוצאות עברו אותו תהליך: המודל קיבל בעיות פתוחות, כ-4,000, והשקיע בממוצע שלוש שעות «חשיבה» של ChatGPT Pro לכל תוצאה. אחר כך התשובות קובצו למשפחות וסוננו לפי חשיבות. החריגים נאמרים במפורש: התחום ללא אפסים של פונקציית זטא והשערת הודג' ליריעות אבליות CM לא עברו בתהליך הכללי, ואת הטקסט על Re(s) > 11/12 ערכו בני אדם.

השמות ברשימה גדולים. השערת רימן הכמעט-מלאה: לפונקציית זטא ולכל פונקציות L של דיריכלה אין אפסים כאשר Re s > 7/8. מעריך כפל מטריצות ω ≤ 9/4 מעל המספרים המרוכבים. השערת ברנט על מעגלים המילטוניים. דוגמאות נגדיות לכמה מהשערות קפלנסקי. נוסחת ברץ' וסווינרטון-דייר לחלק מהעקומים האליפטיים. את המודל עצמו OpenAI מבטיחה לשחרר «responsibly», בלי תאריך.

עוד פרט נראה רק בשמות התיקיות. על כל כתב יד מופיע תאריך, ו-564 מתוך 722 מתוארכים ל-23–27 בספטמבר, מתוכם 370 נופלים על יומיים בלבד, 23 ו-24 בספטמבר. עוד 112 מסומנים 5 באוקטובר, יום לפני הפרסום.

משפחות תוצאות שיש להן קישור ל-Lean ב-CONTENTS.md. ל-137 אין, ובהן נוסחת ברץ' וסווינרטון-דייר

ספירה של Codearia לפי github.com/openai/math, 7 באוקטובר 2026

«יש Lean» לא אומר «נבדק»

הסיכומים כותבים ש«רבות מההוכחות עברו פורמליזציה». זה נכון, אבל הניסוח מסתיר שלוש הסתייגויות ש-OpenAI עצמה השאירה במאגר.

הראשונה: ל-235 משפחות יש קישור ל-Lean, ו-137 נשענות על טקסט בלבד. ה-README אומר את זה ישירות: «Some of the unformalized results could have issues», ומבטיח לתקן מהר.

השנייה: הפורמליזציה מכסה לעיתים קרובות את המשפט המרכזי, לא את המאמר כולו. בתיאור חלק ה-Lean של השערת רימן הכמעט-מלאה כתוב שהחסם 7/8 הוכח פורמלית, ואילו הנספחים המאוחרים של המאמר לא נכנסו לפורמליזציה.

השלישית: הקטלוג lean/formalization.yaml מונה 162 מאמרים שהתוצאה המרכזית שלהם עברה פורמליזציה. בשדה ההיקף כתוב «Partial progress», ובשדה הביקורת status: unchecked. Lean מבטיח שהגזירה תקינה. האם הניסוח הפורמלי הוא בדיוק הטענה שבכותרת המאמר, את זה בודק אדם, ולפי הסימון של OpenAI עצמה הבדיקה הזו לא נעשתה.

מה ביקשו המתמטיקאים ומה OpenAI עשתה

ב-21 בספטמבר הוקמה במכון למחקר מתקדם בפרינסטון קבוצת יועצים, AGMAI: תשעה מתמטיקאים. אין לה סמכות לקבוע באיזה קצב OpenAI עוסקת במתמטיקה, רק לייעץ איך לפרסם. ב-29 בספטמבר היא פרסמה המלצות על סמך יותר מ-600 תגובות של עמיתים, ופתחה במשפט שקשה לקרוא אחרת: «we do not endorse this practice, and we ask them to stop testing advanced mathematical problems on proprietary models».

השחרור הגיע שבוע אחר כך. השווינו סעיף מול סעיף.

המלצת AGMAI, 29 בספטמברמה יש בשחרור מ-6 באוקטובר
שם המודל לכל תוצאה«Unreleased internal OpenAI model», בלי שם
פרומפטיםאין במאגר
סיכום נימוקים לכל תוצאהל-10 מתוך 372 משפחות
זמן ועלות החישובממוצע: שלוש שעות ChatGPT Pro לתוצאה, בלי סכום בדולרים
מאגר שלא בשליטת מעבדת AIה-GitHub של OpenAI; פלטפורמות עצמאיות «נבחנות»
פורמליזציה ככל האפשר235 משפחות עם קישור ל-Lean, הקטלוג מסומן unchecked

הקבוצה עצמה הגיבה ב-7 באוקטובר באיפוק: השחרור הוא «the beginning, not the completion, of the process of human understanding». את ההמלצות שלה היא חזרה ואישרה.

איך לבדוק הוכחה של OpenAI בעצמכם

הצד החזק של השחרור נמצא במקום אחר. לתוצאות שעברו פורמליזציה OpenAI צירפה משימות ל-comparator, כלי של Lean FRO שבודק הוכחה מול ניסוח שנכתב מראש. כל אחד יכול לחזור על הבדיקה. ה-README ממליץ לא לבנות את כל הספרייה בבת אחת: יש בה 122,140 קבצי ‎.lean, והבנייה עלולה להיתקע במגבלת המערכת vm.max_map_count, ולכן בודקים תוצאה אחת בכל פעם.

בדיקת השערת רימן הכמעט-מלאה מתיקיית lean/
lake update
lake exe cache get
lake env comparator ComparatorChallenges/QuasiRiemannHypothesis.json

למחרת עשה את זה משתמש בפורום של OpenAI, davegoldblatt, ואת הבדיקה עצמה הריץ Claude Code. התוצאה: 2,924 מודולים נבנו בלי שגיאות ובלי אזהרות, וההוכחה התקבלה גם ב-comparator וגם בליבה העצמאית nanoda. ההסתייגות שלו מדויקת יותר מכל כותרת: «this checks the Lean proof, not the paper». ריצה אחת, מכונה אחת, ומה שנבדק הוא הטקסט הפורמלי, לא המאמר.

מה לקחת מזה למי שעובד עם סוכנים

הדעה שלנו, ואפשר להתווכח איתה: התוצאה המרכזית של השחרור היא לא 722 כתבי היד, אלא כמה קל נעשה להבדיל בין מה שנבדק למה שנטען. איפה שיש משימת comparator, בדיקת החלק הפורמלי מסתכמת בפקודה אחת, וסוכן יכול להריץ אותה. איפה שאין, נשארים המוניטין של החברה ו-«could have issues». נתברר כטועים אם מתמטיקאים עצמאיים ימצאו בחודשים הקרובים שגיאות רציניות דווקא בחלק שעבר פורמליזציה: אז הגבול עובר במקום אחר.

לסוכנים שלכם המסקנה זהה לזו של נחיל נאבייה-סטוקס. טסטים, טיפוסים והבנייה הם ה-Lean שלכם, וסוקר נפרד הוא ה-comparator: הוא בודק שנעשה מה שביקשו, ולא רק שהקוד מתקמפל. איך לבנות בדיקה כזו לפיצ'ר AI במוצר, מוסבר בפירוק שלנו של מבחן ו-hillclimb ל-Claude API. ואת המבצע ואת הבודק כדאי להפריד לסוכני משנה שונים.

הנתונים נכונים ל-7 באוקטובר 2026

ספירת המשפחות עם קישור ל-Lean נעשתה לפי CONTENTS.md בגרסה הראשונה של המאגר. OpenAI מבטיחה להוסיף פורמליזציות ולשמור היסטוריית גרסאות, כך שהחלק הבדוק יגדל. בדקו את ה-README ואת formalization.yaml העדכניים.

מקורות7להרחיב
  1. OpenAI, «Sharing AI progress in mathematics», 6 באוקטובר 2026 — https://openai.com/index/sharing-ai-progress-in-mathematics/
  2. OpenAI, המאגר openai/math: README, CONTENTS.md, lean/formalization.yaml, lean/docs/003.md, 6 באוקטובר 2026 — https://github.com/openai/math
  3. AGMAI, «Responsible Release of AI-Generated Mathematics», 29 בספטמבר 2026 — https://agmai.org/general-sep29/
  4. AGMAI, «On OpenAI's Release of Mathematical Results», 7 באוקטובר 2026 — https://proofsandprompts.com/2026/10/07/on-openais-release-of-mathematical-results/
  5. davegoldblatt, בדיקה חוזרת של משפחה 003, הפורום של OpenAI, 7 באוקטובר 2026 — https://community.openai.com/t/first-look-at-mathematics-manuscripts-from-an-internal-frontier-model-at-openai/1403886
  6. TechCrunch, «OpenAI forms math advisory group as its AI resolves more than 100 open problems», 21 בספטמבר 2026 — https://techcrunch.com/2026/09/21/openai-forms-math-advisory-group-as-its-ai-resolves-more-than-100-open-problems/
  7. Gizmodo, «OpenAI Dumps 377 New Math Results on GitHub», 6 באוקטובר 2026 — https://gizmodo.com/openai-dumps-377-new-math-results-on-github-publishes-hand-wringing-blog-post-2000822613

תגובות