
Gall robot sydd â model AI roboteg Gemini daflu pêl -fasged i'r cylch.
Ychydig ddyddiau yn ôl, mae DeepMind Google wedi cymhwyso'r model iaith mawr (LLM) Gemini i robotiaid. Gyda'r model, meddai'r cwmni, gall robotiaid gyflawni rhai tasgau heb orfod arsylwi symudiadau robotiaid eraill. Er enghraifft, "dunk" pêl -fasged bach i mewn i'r cylch ar y bwrdd.
Mae DeepMind yn un o'r cwmnïau sy'n ceisio datblygu bots pwrpas cyffredinol gan ddefnyddio technoleg chatbot. Fodd bynnag, o ystyried bod modelau o'r fath yn dueddol o gynhyrchu gwallau a chanlyniadau niweidiol, mae gan y llwybr technegol hwn oblygiadau diogelwch.
Mae'r tîm ymchwil yn gobeithio datblygu peiriant sy'n reddfol i weithredu ac sy'n gallu cyflawni amrywiaeth o dasgau corfforol heb oruchwyliaeth ddynol na chyn-raglenni. Nododd Carolina Parada, pennaeth y tîm roboteg yn Deepmind,, trwy gysylltu model Gemini, y gall datblygwyr wella gallu'r robot i "ddeall iaith naturiol a chanfod y byd corfforol ar lefel well."
Rhyddhawyd y model, o'r enw Gemini Robotics, ar Fawrth 12. Dywedodd Alexander Khazatsky, cyd-sylfaenydd ac ymchwilydd AI yn Collectedai, cwmni deallusrwydd artiffisial Americanaidd (AI), fod hwn yn "gam bach a diriaethol" tuag at nod robotiaid cyffredinol.
Mae'r tîm DeepMind yn seiliedig ar ei fodel gweledigaeth ac iaith o'r radd flaenaf, Gemini 2. 0, sy'n cael ei hyfforddi trwy ddadansoddi patrymau mewn llawer iawn o ddata.
Mae'r tîm wedi datblygu fersiwn bwrpasol o Gemini i wella galluoedd tasgau sy'n cynnwys ffiseg 3D a rhesymu gofodol, megis rhagweld trywydd gwrthrych neu nodi'r un rhan o wrthrych o ddelweddau a gymerwyd o wahanol onglau.
Yn ogystal, hyfforddodd yr ymchwilwyr y model gyda miloedd o oriau o ddata demo robot ymarferol, a weithredir o bell. Mae hyn yn caniatáu i "ymennydd" y robot gyflawni tasgau yn y byd go iawn, yn debyg i sut y gall LLMs gysylltu'r gair nesaf mewn brawddeg trwy ddysgu.
Profodd yr ymchwilwyr roboteg Gemini ar robotiaid humanoid a breichiau robotig gan ddefnyddio gostyngwyr harmonig, gan gwmpasu tasgau a ddaeth i'r amlwg mewn hyfforddiant yn ogystal â thasgau newydd nad oeddent wedi bod yn agored iddynt. Maen nhw'n dweud bod y robot gyda'r model yn perfformio'n well na'i gystadleuwyr mewn tasgau cyfarwydd a newydd gyda manylion wedi'u haddasu.
Mewn tasgau y mae angen eu trin yn dyner, fel origami neu sipio sach gefn, mae gan y robot gyfradd llwyddiant o fwy na 70% ar ôl gwylio llai na 100 o wrthdystiadau. Methodd robotiaid gan ddefnyddio modelau eraill bron i gyd.
Mae Khazatsky yn credu bod tîm Google wedi gwneud gwaith gwych o fewnblannu synnwyr cyffredin i "ymennydd" y robot, ond mae'n nodi y bydd y naid go iawn yn dod o ddysgu o ddata a gasglwyd yn y "byd go iawn anhrefnus" yn hytrach nag mewn amgylchedd labordy.
Daw diogelwch yn her sylweddol wrth gymhwyso modelau o'r fath. Dywedodd Vikas Sindhwani, Robotics ac Ymchwilydd AI yn Deepmind yn Efrog Newydd, UDA: "I ddechrau, bydd robotiaid yn cadw pellter diogel oddi wrth fodau dynol. Yn y dyfodol, byddwn yn raddol yn gweithredu tasgau mwy rhyngweithiol a chydweithredol."
