Kai įmonės pradeda bandyti generatyvųjį AI ribotuose prototipuose ir pradeda juos gaminti, jos vis labiau atsižvelgia į kainą. Galų gale, naudoti didelių kalbų modelius nėra pigu. Vienas iš būdų sumažinti išlaidas yra grįžti prie senos koncepcijos: talpyklos. Kitas būdas – nukreipti paprastesnes užklausas į mažesnius, ekonomiškesnius modelius. Re:invent konferencijoje Las Vegase AWS šiandien paskelbė apie abi šias savo „Bedrock LLM“ prieglobos paslaugos funkcijas.
Pirmiausia pakalbėkime apie talpyklos paslaugą. „Tarkime, kad yra dokumentas, o keli žmonės užduoda klausimus apie tą patį dokumentą. Kiekvieną kartą, kai mokate“, – pasakojo Atul Deo, „Bedrock“ produktų direktorius. „Ir šie kontekstiniai langai vis ilgėja. Pavyzdžiui, su Nova turėsime 300 000 (žetonų) konteksto ir 2 milijonus (žetonų) konteksto. Manau, kad kitais metais jis gali būti dar didesnis.
Talpyklos kaupimas iš esmės užtikrina, kad jums nereikės mokėti už modelio pasikartojančius darbus ir pakartotinai apdoroti tas pačias (arba iš esmės panašias) užklausas. Anot AWS, tai gali sumažinti sąnaudas iki 90 proc., tačiau dar vienas šalutinis rezultatas yra tai, kad atsakymo grąžinimo iš modelio delsa yra žymiai mažesnė (AWS teigia, kad iki 85 proc.). „Adobe“, kuri išbandė greitą kai kurių generuojamųjų AI programų talpyklą „Bedrock“, pastebėjo, kad atsako laikas sumažėjo 72 proc.
Kita svarbi nauja funkcija yra protingas greitas „Bedrock“ maršruto parinkimas. Taip „Bedrock“ gali automatiškai nukreipti raginimus į skirtingus tos pačios modelių šeimos modelius, kad padėtų įmonėms rasti tinkamą našumo ir sąnaudų pusiausvyrą. Sistema automatiškai numato (naudodama mažos kalbos modelį), kaip kiekvienas modelis veiks pagal pateiktą užklausą ir atitinkamai nukreipia užklausą.

„Kartais mano užklausa gali būti labai paprasta. Ar tikrai man reikia siųsti tą užklausą į galingiausią modelį, kuris yra labai brangus ir lėtas? Tikriausiai ne. Taigi iš esmės norite sukurti tokią sąvoką: „Ei, vykdymo metu, remiantis gaunamu raginimu, nusiųskite tinkamą užklausą tinkamam modeliui“, – paaiškino Deo.
Žinoma, LLM maršruto parinkimas nėra nauja koncepcija. Pradedantieji, tokie kaip „Marsian“, ir daugelis atvirojo kodo projektų taip pat sprendžia šią problemą, tačiau AWS greičiausiai teigs, kad jos pasiūlymas skiriasi tuo, kad maršrutizatorius gali protingai nukreipti užklausas be didelio žmogaus indėlio. Tačiau jis taip pat yra ribotas, nes gali nukreipti užklausas tik į tos pačios modelių šeimos modelius. Tačiau ilgainiui, Deo man pasakė, komanda planuoja išplėsti šią sistemą ir suteikti vartotojams daugiau pritaikymo galimybių.

Galiausiai, AWS taip pat pristato naują „Bedrock“ prekyvietę. Deo teigimu, idėja yra ta, kad nors „Amazon“ bendradarbiauja su daugeliu didesnių modelių tiekėjų, dabar yra šimtai specializuotų modelių, kuriuose gali būti tik keli tam skirti vartotojai. Kadangi tie klientai prašo bendrovės juos palaikyti, AWS pradeda šių modelių rinką, kur vienintelis esminis skirtumas yra tas, kad vartotojai turės patys aprūpinti ir valdyti savo infrastruktūros pajėgumus – tai „Bedrock“ paprastai tvarko automatiškai. Iš viso AWS pasiūlys apie 100 šių naujų ir specializuotų modelių, kurių bus daugiau.