Локальний ШІ · виміряна програмна інженерія
Створюємо Artificial General Engineer з вимірюваними результатами
1UA-AGE розв’язав 68 із 300 задач SWE-bench Lite з локальним ШІ та офіційним засобом оцінювання.

1UA-AGE завершив кампанію оцінювання SWE-bench Lite з результатом 68 розв’язаних задач із 300 — 22,67%. Патчі оцінювалися незміненим офіційним evaluator SWE-bench версії 4.0.4. Його підсумкова кількість збіглася з нашим фінальним результатом.
Для нашого українського deep-tech проєкту це конкретний етап у створенні Artificial General Engineer для фізичного світу. Програмна інженерія — частина цього задуму: інженерна система має працювати з виконуваними інструментами, реагувати на збої та створювати результати, які можна перевірити за визначеними вимогами.
Ця кампанія дає нам виміряну базову точку для подальшої роботи.
SWE-bench використовує реальні задачі з наявних програмних репозиторіїв. Піднабір Lite містить 300 задач. Під час оцінювання застосовується згенерований патч і запускаються відповідні тести, які визначають, чи розв’язано задачу. Успішний результат залежить від поведінки зміненого програмного забезпечення під час перевірок бенчмарку. [1]
Виміряний результат
Наш головний показник використовує повний знаменник у 300 задач, включно з тими, де інфраструктура не дозволила розпочати місію.
| Показник | Результат |
|---|---|
| Розв’язано в повному наборі SWE-bench Lite | 68 / 300 — 22,67% |
| Розв’язано серед задач, для яких відбулася місія | 68 / 239 — 28,45% |
| Розв’язано серед задач, де викликалася локальна модель | 68 / 238 — 28,57% |
| Оцінено патчів | 202 |
| Помилок evaluator під час оцінювання цих патчів | 0 |
Два умовні показники допомагають оцінити охоплення виконання. 22,67% залишається основним публічним результатом. Із 202 оцінених патчів 68 розв’язали свої задачі, а 134 — ні. Ще 37 місій не створили патча, включно з однією відмовою за політикою безпеки. Інфраструктура не дозволила виконати місії для решти 61 задачі.
Виконавець використовував локальний інференс Google Gemma на нашому ASUS Ascent GX10 з NVIDIA GB10. OpenAI Codex і Anthropic Claude допомагали створювати та підтримувати систему й інфраструктуру оцінювання; задачі бенчмарку виконував runtime з локальною моделлю. Розмежування цих ролей — частина точної атрибуції.
Кампанія також показала значення надійності виконання. Відновлювальний повтор охопив 38 задач, яких торкнувся інфраструктурний інцидент, і замінив їхні результати після інциденту. Він додав 15 розв’язаних задач, збільшивши загальну кількість із 53 до 68.
Це відновлення демонструє істотний внесок інфраструктури в попереднє зниження результату. Воно також дає практичний орієнтир для розробки: можливості моделі, середовище виконання агента та шлях до перевірки впливають на результат, який отримує користувач. Удосконалення цього шляху — змістовна інженерна робота.
Саме тут ми бачимо роботу 1UA-AGE на передовому краї: у поєднанні локального міркування ШІ з виконанням інструментів і перевірюваними інженерними результатами. Наш внесок — розробка системи навколо моделі: механізмів, через які мета стає роботою, спостереження впливають на наступні рішення, а завершені артефакти проходять визначені перевірки.
Для інженерії фізичних виробів ці перевірки мають охоплювати відповідні розрахунки, конструктивні обмеження, докази й зрештою фізичну валідацію. SWE-bench вимірює програмну спроможність у межах цієї ширшої програми. Artificial General Engineer залишається в розробці.
Ми публікуємо це як результат, отриманий офіційним evaluator SWE-bench. Це ще не офіційний бал у leaderboard: включення до нього потребує окремої процедури подання та розгляду. [2] Результат фіксує продуктивність за розкритих умов кампанії, а не місце серед інших систем.
Кампанію бенчмарку закрито, і наші обчислювальні ресурси повертаються до розробки продукту. Наступна мета — поєднати інженерні спроможності в цілісні робочі процеси й показати, що запропоноване програмне поліпшення може бути створене, перевірене та прийняте в контрольованому процесі. Будь-яке твердження про самовдосконалення потребуватиме доказів, що зміна поліпшує цільову спроможність і зберігає керівні вимоги.
Для потенційних партнерів значення практичне: тепер є кількісна базова оцінка програмної інженерії, яку можна розглядати разом із призначенням продукту та потребами валідації. Наступна розмова може стосуватися конкретних задач, критеріїв приймання та доказів.
Ми створюємо 1UA-AGE в Україні з метою зробити інженерний інтелект корисним на локальному обладнанні. Цей етап дає нам 68 розв’язаних задач, чіткий облік решти невдач і міцнішу основу для наступної стадії розробки.
Розкриття умов оцінювання
Кампанія використовувала набір SWE-bench Lite із 300 задач та незмінений swebench 4.0.4. Конфігурація локальної моделі — Gemma 4 26B-A4B, NVFP4, MTP(3), на платформі ARM64. Підготовка середовищ та отримання залежностей для оцінювання використовували інтернет; локальний інференс не означає повної ізоляції всієї кампанії від мережі. Відновлювальний повтор 38 задач дав 29 патчів і дев’ять порожніх результатів та замінив відповідні результати інциденту. Розкриті відхилення включають перезапуск vLLM і час початку запуску, відмову за політикою безпеки для pytest-dev__pytest-11143 та мережевий packet trace лише для початкового запуску. Внутрішній підсумковий статус кампанії — ACCEPTED_WITH_DISCLOSED_DEVIATIONS; це не прийняття leaderboard SWE-bench і не незалежна сертифікація. Згадування постачальників не означає партнерства чи їхнього схвалення.