„Google“ го претстави новиот „Gemini 4 Argon“, модел наменет за најсложените задачи со вештачка интелигенција. Првите резултати од тестирањата покажуваат интересна промена во односот на силите меѓу водечките модели.
„Google“ го претстави „Gemini 4 Argon“, нов модел наменет за сложени задачи во програмирањето, финансиите, правото и сајбер-безбедноста. Компанијата тврди дека моделот на нејзините сопствени бенчмарк-тестови ги надминал конкурентските модели на „OpenAI“ и „Anthropic“ во поголем број категории. „Argon“ засега не е достапен за пошироката јавност, туку „Google“ најпрво го става на располагање на ограничен број партнери од областа на безбедноста.
Моделот е создаден за задачи кои бараат повеќе последователни чекори, а не само генерирање одговор на едно прашање. Има контекстен прозорец од еден милион токени и може да обработува исклучително големи количества материјал, што „Google“ го наведува како една од неговите поважни карактеристики при работа со големи бази на програмски код и обемни документи. Компанијата веќе го користи интерно за програмирање и други задачи, но дури пошироката употреба ќе покаже како се однесува надвор од контролирана средина.

Резултатите не се исти на секој тест
Според резултатите што ги објави „Google“, „Gemini 4 Argon“ бил прв во 13 од 19 споредби со модели како „GPT-6 Astra“ и „Claude Opus 5.5“, додека на еден тест резултатот бил изедначен со моделот на „OpenAI“. На тестот „DeepSWE v1.1“, кој ја мери способноста за решавање софтверски проблеми, „Argon“ постигнал 77,9 проценти, додека „Claude Opus 5.5“ и „GPT-6 Astra“ имале 74,2, односно 74,1 процент. Тоа, сепак, не значи дека „Argon“ е најуспешен во сите видови задачи.
На други тестови резултатите биле во спротивна насока. На „FrontierSWE v2“, „GPT-6 Astra“ постигнал 65,5 проценти, додека „Argon“ имал 55 проценти, а на „Terminal-Bench 4.0“, „Claude Opus 5.5“ со 66,4 проценти бил пред моделот на „Google“, кој постигнал 57,4 проценти. Поради тоа, предноста што ја прикажува „Google“ се однесува на конкретни категории и не може да се сведе на едноставно тврдење дека „Argon“ е подобар од сите конкуренти.

Голем фокус на сајбер-безбедноста
Една од главните насоки во развојот на „Gemini 4 Argon“ е сајбер-безбедноста. „Google“ наведува дека моделот може да пронаоѓа, проверува и поправа одредени софтверски ранливости, па прв пристап добила ограничена група експерти преку програма наменета за тестирање на таквите способности. Пошироката достапност засега е одложена, додека компанијата проверува како моделот се однесува во ситуации во кои има пристап до вистински безбедносни задачи.
„Argon“ се користи и во рамките на „Google“ за програмирање, откривање грешки и работа на големи софтверски проекти. Компанијата наведува и пример со анализа на телеметриски податоци, која резултирала со заштеда од околу 300 TiB меморија во нејзините центри за податоци. Таквите податоци доаѓаат директно од „Google“, па ќе бидат потребни независни проверки за да се утврди во колкава мера слични резултати можат да се повторат во други средини.

Засега не е достапен за сите
Иако „Google“ го претстави моделот, корисниците во моментов не можат едноставно да го отворат „Gemini“ и да го изберат „Argon“ за секојдневна работа. Прв пристап имаат избрани партнери од областа на сајбер-безбедноста, додека компанијата истовремено спроведува дополнителни тестирања пред да го понуди моделот на програмерите, компаниите и другите корисници. Нема ниту гаранција дека конечната верзија ќе ги има целосно истите карактеристики како моделот што сега се тестира.
„Google“ најави почетна цена од 2 долари за милион влезни токени и 10 долари за милион излезни токени. Тоа е цената за почетната понуда и може да се промени кога моделот ќе стане пошироко достапен. Засега поважно е тоа што корисниците сè уште немаат можност да ги проверат резултатите од бенчмарк-тестовите на „Google“ во секојдневната работа, под исти услови.

„Google“ влегува во нова рунда од трката
„Gemini 4 Argon“ пристигнува во момент кога најголемите "AI"-модели сè почесто се споредуваат според конкретни задачи, наместо преку еден универзален резултат. Податоците на „Google“ му даваат предност на „Argon“ во одредени категории, но истовремено покажуваат дека „GPT“ и „Claude“ имаат тестови на кои постигнуваат подобри резултати. Поради тоа, споредбите од независни тестери ќе бидат особено значајни кога „Argon“ ќе излезе од ограничената фаза.
Притоа, „Google“ го прескокна планираниот „Gemini 3.5 Pro“ и директно премина на „Gemini 4“, по период во кој главно претставуваше помали модели од серијата „Flash“. „Argon“ сега треба да го помине и тестот на реална употреба, каде што моделите се соочуваат со различни податоци, непредвидени барања и задачи кои не се однапред подготвени за бенчмарк-тестирање. Дури тогаш ќе може попрецизно да се види во колкава мера резултатите што „Google“ сега ги објавува одговараат на вистинските перформанси на моделот.









