
Modeli ya mwingiliano ni usanifu wa akili bandia unaoweza kuchakata sauti, video na maandishi kwa mfululizo na kuingilia wakati mazungumzo bado yanaendelea, tofauti na mpangilio wa kawaida wa “mtumiaji anazungumza, modeli inasubiri, kisha modeli inajibu”. Utafiti wa Travis Gilly unasema kwamba mbinu hii, iliyotambulishwa na Thinking Machines Lab mwezi Mei 2026, haipaswi kutathminiwa tu kama suala la ucheleweshaji wa kiufundi na mwingiliano, bali pia kwa upande wa mahusiano ya binadamu, uhuru wa utambuzi, ufikivu na faragha ya watoto.
Nyenzo kuu ya utafiti ni usomaji wa karibu wa matukio mawili ya maonyesho pamoja na tangazo la kiufundi la kampuni. Katika tukio moja, kauli ya mtu anayetumia kifaa cha masikioni inasahihishwa na modeli kwa wakati halisi, huku mtu anayezungumza naye hasikii uingiliaji wa AI. Katika tukio la pili, modeli inayofuatilia chakula na vinywaji kupitia kamera humwingilia mtumiaji mara kwa mara kuhusu anachopaswa kuacha au kuchagua. Kutokana na mifano hii, Gilly anatambua makundi sita ya hatari: ridhaa ya watu wengine, utiifu wa haraka wa watumiaji kwa modeli, ufuatiliaji endelevu wa tabia, uwezekano wa baadhi ya watumiaji walio hatarini kuendeleza utegemezi mkubwa zaidi kwa mfumo, mawasiliano baina ya watu kuandikwa na AI isiyoonekana, na kuibuka kwa hisia ya umahiri kwa mtumiaji bila kujifunza kwa kweli.
Makundi haya si matokeo yaliyopimwa kwa utafiti wa majaribio wa watumiaji. Kazi hii ni uchambuzi wa kina unaounganisha tafsiri ya kimawazo ya tabia zinazoonekana kwenye maonyesho na fasihi kuhusu kuhamisha mzigo wa utambuzi pamoja na udhibiti wa faragha ya watoto nchini Marekani. Tofauti kati ya modeli ya “push”, ambapo AI huingilia bila mtumiaji kuomba, na modeli ya “pull”, ambapo mtumiaji mwenyewe huitisha msaada wakati fulani, ndiyo kiini cha mjadala wa maadili ya usanifu katika makala.
Modeli ya mwingiliano inatofautianaje na msaidizi wa sauti wa kawaida?
Interaction model iliyoelezwa na Thinking Machines Lab huchakata viingizo na matokeo katika mizunguko midogo iliyosawazishwa kwa vipindi vya 200 milisekunde. Kwa hiyo mfumo unaweza kuendelea kufuatilia sauti, picha na maandishi kabla mtumiaji hajamaliza kuzungumza; unaweza kuzungumza kwa wakati mmoja, kuitikia mabadiliko ya kuona na kuingilia wakati unaouona unafaa.
Kipengele hiki hakihusu tu kupunguza ucheleweshaji wa kiufundi. Pia hubadilisha mipaka ya zamu za mazungumzo. Katika mfumo wa kawaida wa mazungumzo, mtumiaji mara nyingi ndiye huamua wakati wa kuuliza swali. Katika usanifu wa mwingiliano endelevu, modeli pia inaweza kuamua wakati wa kujiunga na mazungumzo.
Ukosoaji wa Gilly unalenga hasa kipengele hiki cha pili. Kwa maoni yake, tatizo si kwamba AI inaweza kutoa taarifa, bali kwamba uamuzi wa wakati wa kutoa taarifa unasogea kutoka kwa mtumiaji kwenda kwa mfumo.
Tofauti kuu kati ya push na pull ni nini?
Chanzo kinatenganisha mantiki mbili za usanifu. Katika matumizi ya pull, mtumiaji huitisha msaada wa AI kwa lengo maalumu na kwa wakati maalumu. Kuuliza taarifa kuhusu kazi ya sanaa unayoitazama katika jumba la makumbusho, kubonyeza kitufe ili kuwasha tafsiri ya moja kwa moja, au kuwasha manukuu ya wakati halisi kwa ombi la mtumiaji ni mifano ya hali hii.
Katika matumizi ya push, mfumo hutathmini mazingira kwa mfululizo na unaweza kuamua lini uingilie bila kusubiri mtumiaji aulize swali jipya. Kusahihisha matamshi wakati wa mazungumzo au kutoa maoni ya papo hapo kuhusu chakula kinachoonekana kwenye kamera ni mifano inayotolewa na chanzo.
Mwandishi hakosoa uwezo wa msingi wa teknolojia yenyewe, bali usanifu unaofanya uingiliaji endelevu na wa kuanzishwa na mfumo kuwa njia ya kawaida ya mwingiliano.
Makundi sita ya hatari yaliyotambuliwa na mwandishi ni yapi?
| Kundi la hatari | Dai kuu la chanzo | Aina ya ushahidi |
|---|---|---|
| Ridhaa ya mtu wa tatu | Mtu anayezungumza na mtumiaji wa AI huenda asijue kwamba mazungumzo yanaumbwa kwa wakati halisi na mfumo wa tatu usioonekana. | Usomaji wa karibu wa video ya maonyesho |
| Aibu iliyoundwa na utiifu wa haraka | Modeli inaweza kuonyesha kosa ambalo mtu mwingine halioni kuwa tatizo na kumwelekeza mtumiaji kulisahihisha mara moja na kuomba msamaha. | Tafsiri ya tabia ya demo |
| Ufuatiliaji endelevu wa kurekebisha | Uingiliaji mwingi mdogo unaoonekana kuwa na nia nzuri unaweza, baada ya muda, kupunguza nafasi ya mtumiaji kufanya maamuzi yake mwenyewe. | Uchambuzi wa kikanuni wa hatari |
| Utegemezi unaotofautiana | Baadhi ya watumiaji wanaweza kuthamini uangalizi na mwongozo endelevu zaidi kuliko wengine, hivyo ikawa vigumu zaidi kujitenga na mfumo. | Matukio ya kinadharia ya watumiaji |
| Uingiliaji wa kimahusiano | Iwapo sehemu ya maneno ya mtu yanazalishwa kwa siri na AI, mtu anayezungumza naye anaweza kuingia katika uhusiano akiwa na taarifa pungufu kuhusu chanzo halisi cha mazungumzo. | Analojia ya Cyrano de Bergerac na tafsiri ya demo |
| Udanganyifu wa umahiri | Mtumiaji anaweza kurudia jibu sahihi mara moja lakini huenda hajafanya michakato ya utambuzi inayohitajika kuunda, kutathmini na kukumbuka taarifa hiyo. | Usanisi wa kimawazo na fasihi ya kuhamisha mzigo wa utambuzi |
Jedwali hili si jedwali la mara ngapi madhara hutokea. Utafiti haupimi athari hizi hutokea kwa asilimia gani ya watumiaji, hudumu kwa muda gani, au hutokea kwa sababu katika hali zipi.
Mtu wa tatu asiyeonekana anaingiaje katika mazungumzo ya mtu na mtu?
Katika mfano ulio wazi zaidi kwenye chanzo, watu wawili wanazungumza lakini ni mmoja tu anayesikia sauti ya AI kupitia kifaa chake cha masikioni. Modeli inasahihisha matamshi ya mtumiaji na taarifa anayotoa; mtumiaji huingiza marekebisho hayo mara moja katika mazungumzo. Mtu anayezungumza naye hajui ni maneno gani yanatokana na maarifa ya mtumiaji mwenyewe na ni yapi yanatokana na uingiliaji wa AI uliofika katika sehemu ndogo sana ya sekunde.
Gilly anatafsiri muundo huu kama “uhusiano wa watu wawili kuwa wa watu watatu”. Swali kuu la kimaadili hapa si ikiwa AI iko sahihi au imekosea. Swali ni ikiwa upande mwingine wa mazungumzo anajua kwamba kuna mzalishaji wa tatu wa taarifa katika mawasiliano hayo.
Utafiti unaunganisha hoja hii na tamthilia ya Cyrano de Bergerac ya Edmond Rostand. Kazi ya analojia hiyo si kutoa ushahidi wa majaribio, bali kufanya ionekane wazi hali ya kimahusiano ambapo mtu mmoja huzalisha maneno ya mtu mwingine kwa siri.
Kwa nini marekebisho ya kudumu yanaweza kuwa tofauti na ushauri mmoja mmoja ulio sahihi?
Katika tukio la pili la demo, mtumiaji huomba mfumo umsaidie kujiepusha na vinywaji vyenye kafeini na vyakula vitamu. Modeli hufuatilia vitu alivyonavyo mtumiaji kupitia kamera na kuingilia chaguo zake mara moja.
Chanzo kinasisitiza kwamba ushauri mmoja mmoja si lazima uwe mbaya. Lengo la ukosoaji ni muundo wa jumla wa ushauri huo: ikiwa mtumiaji anaishi siku nzima na sauti inayofuatilia tabia yake na kuamua yenyewe lini ije kuingilia, ni sehemu gani ya mchakato wa kuunda maamuzi bado inabaki kwa mtumiaji?
Ni muhimu kukumbuka kwamba utafiti haujajibu swali hili kwa majaribio. Hakuna kipimo cha aina ya “marekebisho endelevu hupunguza uhuru wa mtumiaji kwa kiwango fulani”. Makala inaweka hatari ya usanifu wa bidhaa katika mfumo wa kimawazo.
Kwa nini mjadala kuhusu ulemavu si wa upande mmoja?
Chanzo kinakataa mtazamo kwamba kuhamisha mzigo wa utambuzi ni hatari kwa kila hali. Kalenda, vikumbusho, vifaa vya mawasiliano vya kuongeza na mbadala, au vifaa vya kusaidia kumbukumbu vinaweza kuwa nyenzo za moja kwa moja za ufikivu kwa baadhi ya watu. Kwa hiyo dai la jumla kwamba “ikiwa mtu hafanyi kazi mwenyewe, uwezo wa utambuzi lazima udhoofike” halitoshi katika muktadha wa ulemavu.
Tofauti kuu katika makala ni ni mchakato gani wa kiakili unaohamishwa, kwa sababu gani, na mtumiaji ana udhibiti kiasi gani juu yake. Chombo kinachopunguza mzigo wa utambuzi kinaweza kuwezesha ufikivu kwa baadhi ya watumiaji, huku mfumo huo huo ukizalisha mkondo wa sauti mbili kwa mfululizo na kuongeza mzigo kwa mtumiaji mwingine mwenye changamoto za uchakataji wa kusikia au ujumuishaji wa hisi.
Tofauti hii inatolewa katika chanzo kama kanuni muhimu ya usanifu: haiwezi kudhaniwa kwamba aina moja ya mwingiliano itatoa matokeo sawa kwa wasifu wote wa ulemavu.
Utafiti unasema nini kuhusu watoto?
Wasiwasi wa mwandishi unalenga zaidi mtoto ambaye anaweza kukua bila kuendeleza kwa kujitegemea michakato fulani ya utambuzi kuliko mtu mzima anayepata jibu tayari. Anaeleza kwamba mfumo unaozungumza kila wakati na kusahihisha kosa kabla mtumiaji hajalitambua mwenyewe unaweza kupunguza nafasi za kuuliza maswali, kukumbuka, kurejesha taarifa kutoka kumbukumbu na kutathmini madai kwa kina.
Hata hivyo chanzo hakijajaribu moja kwa moja matokeo haya ya muda mrefu ya maendeleo kwa watoto wanaotumia interaction model. Tafiti zinazorejelewa kuhusu watoto zinahusu zaidi kuhamisha mzigo wa utambuzi kwa ujumla, udadisi, kuuliza maswali na michakato ya kujifunza. Hivyo utafiti unaweka dhana ya hatari ya maendeleo; hauonyeshi matokeo ya sababu ya muda mrefu.
Mbinu na Matokeo ya Utafiti
Mbinu ya utafiti ni ipi?
Mbinu ya utafiti ina tabaka kuu tatu:
- Usomaji wa karibu wa demo: Ufafanuzi wa kina wa mwingiliano wa binadamu–AI katika video za maonyesho za Thinking Machines Lab.
- Usanisi wa kimawazo wa fasihi: Kutumia fasihi kuhusu kuhamisha mzigo wa utambuzi, kujifunza, kurejesha kumbukumbu, ulemavu na ufikivu katika usanifu wa interaction model.
- Uchambuzi wa kisheria/udhibiti: Kuunganisha mabadiliko ya Children's Online Privacy Protection Act Rule ya Marekani na mifumo inayopokea sauti na picha kwa mfululizo.
Utafiti hauna jaribio linalodhibitiwa, dodoso, mahojiano ya watumiaji, ufuatiliaji wa longitudinal, telemetria ya bidhaa, kipimo cha ukubwa wa athari au kipimo cha matukio ya madhara.
Assistive, substitutive na disruptive offloading ni nini?
Makala inatumia uainishaji wa kuhamisha mzigo wa utambuzi wa Jose na wenzake.
| Aina | Sifa kuu | Uhusiano na interaction model |
|---|---|---|
| Assistive offloading | Chombo husaidia kazi ya utambuzi lakini huhifadhi mamlaka ya mtumiaji ya kufuatilia na kurekebisha. | Kusaidia kukumbuka, matamshi au ukaguzi wa taarifa. |
| Substitutive offloading | Chombo huchukua nafasi ya mchakato wa utambuzi ambao mtumiaji angeufanya mwenyewe. | Jibu hutayarishwa na AI na mtumiaji hulihamisha moja kwa moja katika mazungumzo yake. |
| Disruptive offloading | Teknolojia haichukui kazi tu; pia huvuruga udhibiti wa mtumiaji juu ya wakati na kitu cha kuzingatia. | Mfumo huingia katika mazungumzo bila mtumiaji kuomba na unaweza kuelekeza umakini kutoka nje. |
Dai kuu la Gilly ni kwamba interaction model ya push inayoendelea inaweza kutekeleza majukumu haya matatu kwa wakati mmoja ndani ya mfumo mmoja.
“Udanganyifu wa umahiri” unaweza kutokeaje?
Kulingana na utafiti, mtumiaji anapoweza kuhamisha mara moja taarifa anayosikia katika mazungumzo yake, anaweza kuonekana mwenye maarifa na mwenye ufasaha kutoka nje. Lakini kusema sentensi sahihi hakumaanishi kwamba taarifa hiyo imejengwa katika kumbukumbu ya mtumiaji mwenyewe.
Chanzo kinaunganisha hoja hii na mazoezi ya kurejesha taarifa kutoka kumbukumbu na fasihi ya kujifunza kunakohitaji juhudi. Badala ya mtumiaji kutambua tatizo mwenyewe, kutafuta taarifa, kutathmini chaguo na baadaye kukumbuka, kurudia marekebisho yanayofika ndani ya mamia machache ya milisekunde huunda hali tofauti ya utambuzi kwa ajili ya kujifunza.
Hata hivyo haijapimwa katika utafiti huu kama watumiaji wa interaction model kwa kweli hukumbuka taarifa chache zaidi. “Udanganyifu wa umahiri” hapa si matokeo ya bidhaa yaliyothibitishwa kwa majaribio, bali matumizi ya nadharia iliyopo ya cognitive offloading katika usanifu mpya wa mwingiliano.
Hoja ya COPPA imejengwaje?
Chanzo kinatathmini Children's Online Privacy Protection Rule iliyorekebishwa mwaka 2025 pamoja na tarehe yake ya utii ya 2026 na usanifu wa interaction model. Mwandishi analenga hasa hali ambazo sauti au picha ya uso wa watoto inaweza kuingia katika mfumo kwa bahati wakati wa uchakataji endelevu wa sauti na video.
Mantiki ya hoja ni hii:
- Mfumo unaweza kuchakata sauti na picha za mazingira kwa mfululizo.
- Mkondo huu unaweza kujumuisha watu wengine zaidi ya mtumiaji.
- Baadhi ya vitambulishi vya kibayometriki vya watoto ni taarifa binafsi chini ya COPPA.
- Kwa hiyo katika mazingira ya watumiaji ambako watoto wapo, usanifu wa ridhaa na uchakataji wa data unapaswa kutatuliwa kabla ya ukusanyaji wa data, si baada ya matumizi kuanza.
Gilly anahitimisha kutokana na hili kwamba usanifu katika hali yake ya sasa hauwezi kufuata COPPA. Hatua hii ya mwisho ni tathmini ya kisheria ya mwandishi. Makala haitoi uamuzi wa FTC wa ukiukaji au uamuzi wa mahakama kuhusu interaction model ya Thinking Machines Lab.
Tofauti ni ipi kati ya maelezo ya usalama ya kampuni na utafiti?
Sehemu kuu ya Safety katika tangazo la kiufundi la Thinking Machines Lab inalenga tabia ya kukataa inayolingana na aina ya ingizo katika mwingiliano wa wakati halisi na kudumisha mipaka ya usalama katika mazungumzo marefu. Gilly anasema kwamba wigo wa usalama unapaswa kuwa mpana zaidi ya hayo.
Mada zinazosisitizwa na chanzo ni pamoja na:
- ridhaa ya watu wengine wanaoshiriki katika mazungumzo,
- uingiliaji endelevu wa tabia,
- hali ya maendeleo ya watoto,
- wasifu tofauti wa ulemavu na uchakataji wa hisi,
- mahusiano ya nguvu kazini au ndani ya familia,
- kuhamisha mzigo wa utambuzi na kujifunza,
- faragha ya watoto
vinatajwa.
Ulinganisho huu hauonyeshi kwamba kampuni haiwezi kamwe kudhibiti hatari hizi; unaeleza tu hoja ya Gilly kwamba katika tathmini ya usalama, usalama wa bidhaa unapaswa kuchukuliwa kama eneo pana la kijamii na kiteknolojia kuliko kukataa maudhui pekee.
Kwa nini muundo wa pull unapendekezwa badala ya push?
Pendekezo la suluhisho la utafiti si kuondoa teknolojia yote. Hoja ni kwamba uwezo uleule wa kutambua mazingira na kujibu kwa wakati halisi unaweza kutumiwa katika violesura vingine ambavyo huhifadhi uamuzi wa mtumiaji.
Mifano inayotolewa na chanzo inayofanya kazi kwa ombi la mtumiaji ni pamoja na:
- waongoza wageni wa makumbusho,
- mifumo ya taarifa katika bustani za mimea,
- tafsiri ya moja kwa moja,
- mifumo ya manukuu kwa watumiaji wenye ulemavu wa kusikia
imo.
Katika mifano hii, jambo linaloamua si maudhui ya taarifa, bali nani anaamua msaada uanze lini. Kwa sababu hiyo mwandishi anaweka tofauti ya kimaadili ya usanifu kati ya modeli ya “pull” inayoitishwa na mtumiaji na modeli ya “push” inayoanzishwa na mfumo.
Vikwazo vikuu vya utafiti
| Eneo | Utafiti unachofanya | Utafiti usichofanya |
|---|---|---|
| Tabia ya mtumiaji | Hutafsiri video za maonyesho. | Haufanyi jaribio kwa sampuli wakilishi ya watumiaji. |
| Kujifunza na kumbukumbu | Hutumia fasihi iliyopo ya cognitive offloading. | Haufanyi jaribio la kumbukumbu kwa watumiaji wa interaction model. |
| Ulemavu | Hujadili athari zinazowezekana kulingana na wasifu tofauti wa watumiaji. | Haufanyi jaribio la ufikivu kwa washiriki wenye ulemavu. |
| Maendeleo ya mtoto | Huweka dhana za hatari za muda mrefu. | Haufuatilii watoto wanaotumia interaction model kwa muda mrefu. |
| COPPA | Hutafsiri kisheria athari za udhibiti kwa interaction model. | Hautoi uamuzi maalumu wa FTC kuhusu bidhaa hii. |
| Mara za kutokea kwa madhara | Hutambua makundi sita ya hatari. | Hauhifadhi asilimia ya kutokea kwa hatari au ukubwa wa athari. |
Hitimisho kuu la utafiti linapaswa kusomwaje?
Hitimisho kuu la chanzo si kwamba “AI ya wakati halisi yenye aina nyingi za data ni hatari kiteknolojia”. Hoja iliyo finyu zaidi ni hii: kugeuza uwezo uleule wa kiufundi kuwa bidhaa inayoingilia kwa mfululizo, kwa kujianzishia na bila mtumiaji kuomba kunaweza kuleta hatari tofauti kuhusu ridhaa, uhuru wa utambuzi, ufikivu na faragha ya watoto ikilinganishwa na mfumo mdogo wa msaada unaoitishwa na mtumiaji.
Kiwango cha ushahidi pia kinapaswa kuwekwa kwa usahihi. Makala inazalisha maswali muhimu ya usanifu na nadharia zinazoweza kupimwa, lakini haionyeshi kwa majaribio kwamba madhara ya kisaikolojia na ya maendeleo yanayoelezwa yanatokea kwa watumiaji wa interaction model.
Dokezo la Chanzo na Mbinu
Kichwa asili: I Am Not Allowed: The Voice Thinking Machines Lab Wants In Every Ear
Mwandishi: Travis Gilly
ORCID: 0009-0007-2954-6313
Ushirika: Real Safety AI Foundation, Illinois, United States
Tarehe katika PDF ya chanzo: May 2026, v1
Jukwaa: SSRN
Tarehe ya kupakiwa SSRN: 17 Juni 2026
DOI: 10.2139/ssrn.6855460
Aina ya chanzo na hali ya mapitio ya kitaalamu: Working paper / preprint. Rekodi iliyothibitishwa haionyeshi uchapishaji katika jarida lililopitiwa na wenzao.
Onyo la bibliografia: Taarifa ya “Date Written: May 02, 2026” katika rekodi ya SSRN ni ya mapema kuliko tangazo la Thinking Machines Lab la 11 Mei 2026 ambalo utafiti unalichambua. Kwa kuwa PDF ya chanzo inasema tu “May 2026 (v1)”, Verianla haijasahihisha kimya kimya mkanganyiko huu na haijatumia tarehe ya kiwango cha siku.
Leseni/hakimiliki: Rekodi ya SSRN inaonyesha kwamba haki zote zimehifadhiwa na matumizi tena bila ruhusa hayaruhusiwi. Maandishi ya Verianla hayazalishi tena kauli, mpangilio wa aya au nyenzo za kitamaduni/demo za wahusika wengine kutoka kazi ya chanzo.
Mbinu: Usomaji wa karibu wa maonyesho ya Thinking Machines Lab; usanisi wa kimawazo wa fasihi ya cognitive offloading, kujifunza na ufikivu; uchambuzi wa kisheria wa kikanuni kuhusu udhibiti wa COPPA.
Aina kuu ya ushahidi: Maonyesho ya bidhaa, tangazo la kiufundi la kampuni na vyanzo vya pili vya kitaaluma/kisheria.
Data ya majaribio: Hakuna data asilia ya majaribio iliyokusanywa kutoka kwa watumiaji wa interaction model.
Uchambuzi wa takwimu: Hakuna sampuli, kikundi cha udhibiti, ukubwa wa athari, muda wa kujiamini au jaribio la nadharia kuhusu matokeo ya watumiaji.
Chanzo cha cognitive offloading: Utafiti unachukua tofauti ya assistive, substitutive na disruptive offloading kutoka katika taksonomia ya kimawazo ya Jose na wenzake ya 2025. Chanzo hiki si utafiti wa majaribio wa interaction-model, bali ni makala ya mtazamo inayosanisi fasihi ya saikolojia.
Kikomo cha tafsiri ya kisheria: Ingawa tarehe kuu za udhibiti na wigo wa data ya kibayometriki chini ya COPPA zinaweza kuthibitishwa, hitimisho kuhusu iwapo usanifu wa interaction model unaweza au hauwezi kutii sheria kwa uhakika ni hoja ya kisheria ya Travis Gilly.
Taarifa ya AI/teknolojia saidizi: Mwandishi anaeleza mwishoni mwa kazi kwamba alitumia programu ya speech-to-text Wispr Flow na Anthropic Claude kama teknolojia saidizi.
Mbinu ya uchakataji ya Verianla: Mpangilio wa simulizi wa chanzo wenye msisitizo wa mabishano na analojia za kitamaduni haujapelekwa moja kwa moja. Usanifu wa kiufundi, ridhaa ya mtu wa tatu, cognitive offloading, ufikivu, watoto, COPPA, muundo wa push/pull na mipaka ya ushahidi zimetenganishwa kuwa tabaka tofauti za taarifa za kisayansi/kimaadili na kujengwa upya ndani ya muundo huru wa kielimu wa Kiswahili.

Acha maoni
Anwani yako ya barua pepe haitachapishwa. Sehemu za lazima zimewekewa alama ya *