Вештачка интелигенција го дизајнираше најдобриот AI процесор во светот

- Advertisement -

Од објавувањето на Jalapeño, првиот прилагоден процесор за инференција на OpenAI, чипот и системот изграден околу него се тестирани. Резултатите покажуваат значителни подобрувања во перформансите. Jalapeño може да извршува повеќе работа со вештачка интелигенција по единица моќност, а воедно побрзо враќа одговори.

Jalapeño испорачува и поголем проток и помала латентност со една архитектура, каде што постојните хардверски системи честопати мора да прават компромис помеѓу двете.

- Advertisement -

За корисниците ова би можело да значи побрзи одговори, поодзивни агенти и посигурен пристап како што расте побарувачката. Според OpenAI, овие придобивки ќе помогнат сè поспособната вештачка интелигенција да биде подостапна и широко достапна.

Моделите на OpenAI, исто така, го забрзаа развојот на Jalapeño. Претходните генерации му помогнаа на тимот да го дизајнира и развие чипот, додека најновите модели го забрзуваат начинот на кој го оптимизираат и програмираат.

- Advertisement -

Перформансите на Jalapeño ги опфаќаат GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1T, демонстрирајќи дека архитектурата работи на модели развиени и внатрешно и надворешно во OpenAI. Во сите три случаи, Jalapeño испорача 1,5 до 1,9 пати повеќе работа со вештачка интелигенција по ват при врвен проток и 1,7 до 3,6 пати помала латенција од почеток до крај во споредба со споредливи системи. За високо интерактивни работни оптоварувања, испорача 2,1 до 4,1 пати повисоки перформанси.

Jalapeño е исто така доказ за пошироките придобивки од full-stack. OpenAI може заедно да дизајнира модели, производи, софтвер за услуги, чипови, меморија, мрежи и системи. Jalapeño работи на силикон од прва страна со мерени резултати и тоа е почеток на повеќегенерациска платформа. Во наредните месеци, компанијата планира да го зголеми Jalapeño за да им испорача побрзи, поспособни и поефикасни производи на своите клиенти.

- Advertisement -

За да разберат како Jalapeño функционира во пракса, тие го тестираа на InferenceX, јавен бенчмарк од SemiAnalysis кој го мери целиот процес на задоволување на барањата за вештачка интелигенција. Тие го споредија Jalapeño со водечките комерцијално достапни системи со вештачка интелигенција во тестираниот работен опсег, од високопропусен опсег до високо интерактивна употреба со ниска латенција. Jalapeño испорача подобра комбинација на пропусен опсег, енергетска ефикасност и латенција.

Во сите три јавни модели, Jalapeño испорача подобра комбинација на перформанси по ват и латенција во тестираниот работен опсег, ставајќи го на границата на Парето. За доследно споредување на системите, тие ги нормализираа резултатите користејќи ја објавената моќност на чипот на секој забрзувач. Jalapeño е оценет на 700 вати, иако неговата измерена одржлива моќност остана на или под 550 вати под тестираните работни оптоварувања.

На Kimi, најголемиот јавен модел што го тестираа, испорача приближно 1,5 пати поголема максимална ефикасност по ват и 3,4 пати помала латенција од крај до крај од споредливиот систем. Во интерното тестирање, предноста на Jalapeño дополнително се зголеми кај моделите на OpenAI, што укажува дека архитектурата станува повредна како што работните оптоварувања стануваат поголеми и потешки.

Добивките на Jalapeño доаѓаат од заедничкото дизајнирање на скалабилни чипови, меморија, мрежа, софтвер и системи околу работни оптоварувања на модели на јазици во реалниот свет. Инференцијата на јазичните модели поминува низ неколку различни фази со различни тесни грла. Претходното пополнување, кога системот го обработува барањето, е пресметковно интензивно, додека декодирањето, кога системот генерира токен за одговор по токен, е поограничено од пропусниот опсег на меморијата.

Комуникацијата исто така може да додаде латенција кога податоците мора да се движат помеѓу јадрата и чиповите, оставајќи некои единици за обработка неактивни додека чекаат. Систем кој се истакнува во една фаза може да ја изгуби таа предност додека чека податоци или ја преместува состојбата на моделот помеѓу различни ресурси.

Jalapeño е дизајниран да ги намали доцнењата во движењето на податоците и комуникацијата. Ова значи дека состојбата на моделот, вклучувајќи го и кешот KV што се користи за време на генерирањето на одговор, може експлицитно да се постави и задржи локално додека системот ја активира вистинската комбинација на пресметка, меморија и мрежно поврзување за секоја фаза на инференција.

Мрежата е составен дел од архитектурата. Неговиот голем домен овозможува целото работно оптоварување да остане во рамките на еден поврзан систем, минимизирајќи го движењето на податоците и помагајќи целото барање да остане брзо и ефикасно од почеток до крај. Резултатот е избалансиран и заменлив забрзувач кој може да поддржува променливи архитектури на модели, да се истакнува и во претходното пополнување и во декодирањето и да се адаптира како што се менува рамнотежата помеѓу двете, дефинирачка карактеристика на работното оптоварување на агентите.

Тие користеа вештачка интелигенција за да го дизајнираат чипот и го дизајнираа чипот така што вештачката интелигенција можеше да го програмира.

Вештачката интелигенција одигра директна улога во развојот на Jalapeño, овозможувајќи му на тимот да оди од почетен дизајн до завршување за девет месеци со истражување на имплементации, скратување на циклусите за дизајн, мерење и верификација и континуирано повторување на работното оптоварување на модата.

(Vidi.hr)

(фото: Chat GPT )

- Advertisement -