С СпадокУкраїна: суспільство та історія

Еволюція ШІ-агентів: від перших кроків до локального інтелекту

·4485 слівредакція
Еволюція ШІ-агентів: від перших кроків до локального інтелекту

Від простого автодоповнення до агентів, які працюють на домашніх комп’ютерах. Як великі мовні моделі пройшли шлях від іграшки до повсякденного інструмента.

У 2023 році ChatGPT лише вчився відрізняти ф’ючерс від опціону, міг написати листа орендодавцю і нерідко вигадував неіснуючі закони. Сьогодні ж локальна модель, що працює на звичайній домашній відеокарті навіть без інтернету, справляється з цими завданнями не гірше. Різницю помітити дедалі важче.

Усе почалося з алгоритму, який передбачає наступний токен — слово, частину слова чи символ. Те саме робить клавіатура смартфона, пропонуючи «добре» після «все». Але справжній прорив стався 2017 року, коли дослідники Google опублікували статтю «Attention Is All You Need» з архітектурою трансформера. Вона дозволила моделям враховувати весь контекст і навчатися паралельно.

Google зосередився на розумінні тексту, а OpenAI — на генерації. Перша GPT-2 2019 року налякала пресу ризиком фейків, а GPT-3 2020-го вразила здібностями, яких ніхто не програмував: переклад, написання коду, імітація стилю.

30 листопада 2022 року OpenAI запустила ChatGPT. За п’ять днів він набрав мільйон користувачів, за два місяці — 100 мільйонів. В Україні сервіс став доступним 18 лютого 2023 року після переговорів Мінцифри з керівництвом OpenAI.

14 березня 2023 року вийшла GPT-4, яка складала професійні іспити й рідше помилялася. Тоді ж Anthropic відкрила чат-бота Claude, а Microsoft вбудувала ШІ в пошуковик Bing. Google поспіхом запустив Bard, а Ілон Маск — Grok.

Паралельно з хмарними розвивалися локальні моделі. У лютому 2023 року Meta розіслала дослідникам модель LLaMA, ваги якої за тиждень опинилися на анонімному форумі 4chan. Це дозволило запускати ШІ на звичайному залізі. Болгарський розробник Георгі Герганов створив легкий рушій llama.cpp, а спільнота додала квантування — стискання ваг із невеликою втратою якості.

2024 рік приніс мультимодальні моделі: GPT-4o відповідала голосом і бачила зображення, Claude 3 Opus потіснив GPT-4 у тестах. З’явилися міркувальні моделі, які перед відповіддю генерують внутрішній ланцюжок міркувань.

20 січня 2025 року китайська DeepSeek виклала модель R1 з відкритими вагами, яка міркувала на рівні фронтірної o1. Акції Nvidia впали на 17%, а ринок зрозумів: відкриті моделі наздоганяють фронтір за лічені місяці.

Станом на середину 2026 року ШІ-агенти стали звичними. OpenAI випустила родину GPT-5.6, Anthropic — Claude 5, Google — Gemini 3.5. Microsoft вбудувала власні моделі MAI в Copilot. З’явилися відкриті рушії особистих агентів, як-от OpenClaw, що живуть на машині користувача й виконують завдання через месенджери.

Навіщо запускати модель локально? Приватність — дані не йдуть у хмару. Незалежність — без інтернету й передплат. Але це не безплатно: потрібна відеокарта з 8–24 ГБ пам’яті, час на налаштування й обслуговування. Моделі до 30 млрд параметрів реально запустити на одній GeForce RTX 3090 чи 4090. Для більших — Mac Studio або NVIDIA DGX Spark.

Сьогодні локальна модель середнього класу справляється з побутовими задачами на рівні ChatGPT початку 2023 року. А те, що колись вимагало серверної зали й підписки, тепер поміщається під стіл і працює безплатно. Якщо тенденція втримається, за кілька років домашня відеокарта зможе запускати сьогоднішній фронтір.

Читайте також