1UA—AGE
Головна→Newsroom

Локальний ШІ · виміряна програмна інженерія

Створюємо Artificial General Engineer з вимірюваними результатами

1UA-AGE розв’язав 68 із 300 задач SWE-bench Lite з локальним ШІ та офіційним засобом оцінювання.

Редакційна ілюстрація локальної інженерної ШІ-станції з результатом SWE-bench Lite — 68 розв’язаних задач із 300
Концептуальна редакційна ілюстрація; це не фотографія обладнання бенчмарку.

1UA-AGE завершив кампанію оцінювання SWE-bench Lite з результатом 68 розв’язаних задач із 300 — 22,67%. Патчі оцінювалися незміненим офіційним evaluator SWE-bench версії 4.0.4. Його підсумкова кількість збіглася з нашим фінальним результатом.

Для нашого українського deep-tech проєкту це конкретний етап у створенні Artificial General Engineer для фізичного світу. Програмна інженерія — частина цього задуму: інженерна система має працювати з виконуваними інструментами, реагувати на збої та створювати результати, які можна перевірити за визначеними вимогами.

Ця кампанія дає нам виміряну базову точку для подальшої роботи.

SWE-bench використовує реальні задачі з наявних програмних репозиторіїв. Піднабір Lite містить 300 задач. Під час оцінювання застосовується згенерований патч і запускаються відповідні тести, які визначають, чи розв’язано задачу. Успішний результат залежить від поведінки зміненого програмного забезпечення під час перевірок бенчмарку. [1]

Виміряний результат

Наш головний показник використовує повний знаменник у 300 задач, включно з тими, де інфраструктура не дозволила розпочати місію.

ПоказникРезультат
Розв’язано в повному наборі SWE-bench Lite68 / 300 — 22,67%
Розв’язано серед задач, для яких відбулася місія68 / 239 — 28,45%
Розв’язано серед задач, де викликалася локальна модель68 / 238 — 28,57%
Оцінено патчів202
Помилок evaluator під час оцінювання цих патчів0

Два умовні показники допомагають оцінити охоплення виконання. 22,67% залишається основним публічним результатом. Із 202 оцінених патчів 68 розв’язали свої задачі, а 134 — ні. Ще 37 місій не створили патча, включно з однією відмовою за політикою безпеки. Інфраструктура не дозволила виконати місії для решти 61 задачі.

Виконавець використовував локальний інференс Google Gemma на нашому ASUS Ascent GX10 з NVIDIA GB10. OpenAI Codex і Anthropic Claude допомагали створювати та підтримувати систему й інфраструктуру оцінювання; задачі бенчмарку виконував runtime з локальною моделлю. Розмежування цих ролей — частина точної атрибуції.

Кампанія також показала значення надійності виконання. Відновлювальний повтор охопив 38 задач, яких торкнувся інфраструктурний інцидент, і замінив їхні результати після інциденту. Він додав 15 розв’язаних задач, збільшивши загальну кількість із 53 до 68.

Це відновлення демонструє істотний внесок інфраструктури в попереднє зниження результату. Воно також дає практичний орієнтир для розробки: можливості моделі, середовище виконання агента та шлях до перевірки впливають на результат, який отримує користувач. Удосконалення цього шляху — змістовна інженерна робота.

Саме тут ми бачимо роботу 1UA-AGE на передовому краї: у поєднанні локального міркування ШІ з виконанням інструментів і перевірюваними інженерними результатами. Наш внесок — розробка системи навколо моделі: механізмів, через які мета стає роботою, спостереження впливають на наступні рішення, а завершені артефакти проходять визначені перевірки.

Для інженерії фізичних виробів ці перевірки мають охоплювати відповідні розрахунки, конструктивні обмеження, докази й зрештою фізичну валідацію. SWE-bench вимірює програмну спроможність у межах цієї ширшої програми. Artificial General Engineer залишається в розробці.

Ми публікуємо це як результат, отриманий офіційним evaluator SWE-bench. Це ще не офіційний бал у leaderboard: включення до нього потребує окремої процедури подання та розгляду. [2] Результат фіксує продуктивність за розкритих умов кампанії, а не місце серед інших систем.

Кампанію бенчмарку закрито, і наші обчислювальні ресурси повертаються до розробки продукту. Наступна мета — поєднати інженерні спроможності в цілісні робочі процеси й показати, що запропоноване програмне поліпшення може бути створене, перевірене та прийняте в контрольованому процесі. Будь-яке твердження про самовдосконалення потребуватиме доказів, що зміна поліпшує цільову спроможність і зберігає керівні вимоги.

Для потенційних партнерів значення практичне: тепер є кількісна базова оцінка програмної інженерії, яку можна розглядати разом із призначенням продукту та потребами валідації. Наступна розмова може стосуватися конкретних задач, критеріїв приймання та доказів.

Ми створюємо 1UA-AGE в Україні з метою зробити інженерний інтелект корисним на локальному обладнанні. Цей етап дає нам 68 розв’язаних задач, чіткий облік решти невдач і міцнішу основу для наступної стадії розробки.

Розкриття умов оцінювання

Кампанія використовувала набір SWE-bench Lite із 300 задач та незмінений swebench 4.0.4. Конфігурація локальної моделі — Gemma 4 26B-A4B, NVFP4, MTP(3), на платформі ARM64. Підготовка середовищ та отримання залежностей для оцінювання використовували інтернет; локальний інференс не означає повної ізоляції всієї кампанії від мережі. Відновлювальний повтор 38 задач дав 29 патчів і дев’ять порожніх результатів та замінив відповідні результати інциденту. Розкриті відхилення включають перезапуск vLLM і час початку запуску, відмову за політикою безпеки для pytest-dev__pytest-11143 та мережевий packet trace лише для початкового запуску. Внутрішній підсумковий статус кампанії — ACCEPTED_WITH_DISCLOSED_DEVIATIONS; це не прийняття leaderboard SWE-bench і не незалежна сертифікація. Згадування постачальників не означає партнерства чи їхнього схвалення.

Джерела

[1] Офіційний FAQ SWE-bench — набори даних та оцінювання[2] Офіційний репозиторій подань SWE-bench — участь у leaderboardПолітика доказів і розкриття 1UA-AGE

#MadeInUkraine #1UAAGE #ArtificialGeneralEngineer #EngineeringAI #LocalAI