On-device vs. off-device computing for robotter
Del
Enhver arbejdsbelastning på en robot findes på et af to steder: on-board, via batteriet og brystblæserne, eller off-board, på en vægforsynet server ét LAN-hop væk. Det svære spørgsmål er ikke, om du har brug for begge dele - det har du næsten altid - men hvilken arbejdsbelastning der skal hvorhen, og hvorfor . R08 argumenterer for, at der overhovedet findes et dedikeret kantniveau. Denne artikel handler om beslutningen pr. arbejdsbelastning: motorstyring her, VLM der, STT afhænger, og så videre.
Rammen er præget af meninger. Der er et rigtigt svar pr. arbejdsbyrde, og det rigtige svar ændrer sig, efterhånden som den indbyggede siliciumproduktion indhenter. Vi vil sige, hvilken vej hver brik bevæger sig i 2026-2027.
De to budgetter, der bestemmer alt
En arbejdsbelastning kan køre indbygget, hvis og kun hvis den passer ind i to budgetter samtidigt: strømforbrug og hukommelse . Latens er den tredje begrænsning, men latens fortæller dig normalt, hvilken vej du skal skubbe en arbejdsbelastning, der passer, ikke om den overhovedet passer.
Strømforbrug på en humanoid. En humanoid på 30-50 kg bærer 700-900 Wh batteri. Vedvarende gang trækker 200-500 W fra aktuatorerne, med toppe på 800 W+ under dynamisk bevægelse. Stillestående og tænkning trækker 80-150 W fra aktuatorerne (holdemoment er billigt, holdestilling koster). Det efterlader cirka 60-120 W til alt andet - beregning, sensorer, køleblæsere, radio - hvis du ønsker en brugbar to-timers driftstid. Beregningsbudgettet inden for dette område er 30-80 W vedvarende. At brænde Jetson ved MAX_N (60 W) hele tiden halverer robottens driftstid. Dette er ikke-forhandlingsbart fysik, ikke et designvalg.
Hukommelsesbudget. En Jetson AGX Orin 64 GB er 64 GB LPDDR5, der deles mellem CPU'en og GPU'en . Fratræk operativsystemet (4-6 GB), ROS 2 og producentens SDK (2-4 GB), perceptionsbuffere (2-4 GB til stereodybde og punktskyer) og eventuel applikationskode. Det realistiske LLM/VLM-brugelige budget er 40-48 GB. På et Jetson Thor 128 GB-modul stiger loftet til ~96 GB brugbart. På Orin NX 16 GB falder det til ~8-10 GB brugbart - nok til én lille model.
Off-board er begge budgetter forskellige problemer. En Kentino AI 96 (4× RTX 5090) har 128 GB dedikeret VRAM og 1.0-1.5 kW GPU-kraft under vægmontering. En Kentino AI 256 (8× RTX 5090) fordobler begge dele. Strøm og hukommelse er simpelthen ikke længere begrænsninger - du bytter dem i stedet for kapitaludgifter, rum-HVAC og kabelbaseret netværk.
Indbygget silicium, virkeligheden i 2026
De indbyggede muligheder, der rent faktisk leverer seriøse humanoider og firbenede dyr i dag:
| SoC | INT8 TOPPER (sparsom) | Brugbar hukommelse | Power kuvert | Hvad den kan køre |
|---|---|---|---|---|
| Jetson Orin NX 16 GB | 100 | ~10 GB delt | 10-25 W | YOLO, lille VLM 3B Q4, vækkeord |
| Jetson AGX Orin 64 GB | 275 | ~40 GB delt | 15-60 W | YOLO, VLM 7B Q4 til brugbare priser, 13B LLM |
| Jetson AGX Thor 128 GB (2026) | 2070 FP4 TFLOPS | ~96 GB delt | 40-130 W | VLM 32B Q4 med ekstra plads, dobbeltstrømsoplevelse |
| Snapdragon 8 Gen 3 / QRB-klasse | 45-75 | ~6-10 GB delt | 5-15 W | Stemme, vækkeord, let CV |
| Hailo-8 (M.2-tilføjelsesprogram) | 26 INT8 TOPS | 2-4 GB indbygget hukommelse | 2.5 W typisk | Aflastning af visionsrørledning, MobileNet/YOLO |
| Hailo-15 (vision-SoC) | 20 TOPS | Rørledningsbeboer | 2-5 W | Altid aktivt multikamera CV |
| Intel N97 / i7-1370P co-processor | n/a (CPU + iGPU) | DDR5-vært | 6-45 W | Højniveauorkestrering, ROS 2, lim |
Thor er et skridtskifte, ikke en iteration. 128 GB hukommelsesloftet og de FP4-native Blackwell tensorkerner flytter den indbyggede grænse fra "7B VLM, smerteligt nok" til "32B VLM, nyttigt nok" på én generation. Arbejdsbelastninger, der strukturelt var off-board i 2025 - mellemstore VLM'er, kontinuerlig scenetekstning, mellemstore LLM-planlæggere - bliver indbyggede kandidater i 2026, hvis robottens termiske løsning kan opretholde 100-130 W.
Hailo og den dedikerede NPU-klasse er ikke LLM-acceleratorer. De er vision-pipeline-aflastning: hold den primære Jetson fri til den større model, kør det altid tændte kamera CV (objektdetektion, sporing, grundlæggende VLM-lite) på en 3 W chip.
Snapdragon QRB-klassen er svaret på stemmeorienterede robotter — wake-word, beamforming, STT — hvor en Jetson er overkill, og en Cortex-M er for lille. Nyttig, smal, stadig mere almindelig.
Off-board: Kentino AI-niveauet som reference
Det eksterne mål, der refereres til i hele denne serie, er Kentino AI-serien – vægdrevet, 4U- eller 5U-rack, 4 eller 8 GPU'er på EPYC eller Xeon, på en 10 GbE-switch ét hop fra robotten. De tre niveauer, der er vigtige for robotteknologi:
| dyr | GPU'er | Samlet VRAM | Vedvarende kraft | Største realistiske VLM (INT4) |
|---|---|---|---|---|
| Kentino AI 64/96 (4-GPU) | 4× RTX 5090 eller 4× Pro 6000 | 128-384 GB | 1.8-2.4 kW | 72B med plads til KV-cache |
| Kentino AI 128 (4× Pro 6000 Blackwell) | 4× RTX Pro 6000 96 GB | 384 DK | 2.0-2.6 kW | 72B med fuld kontekst |
| Kentino AI 256 (8-GPU) | 8× RTX 5090 eller 8× Pro 6000 | 256-768 GB | 3.5-4.5 kW | 70B + 32B + 7B samtidigt |
Beslutningsmatricen
Enhver robotarbejdsbelastning sorteres tydeligt i en af fem kategorier: altid on-board , on-board foretrukket , enten , off-board foretrukket , off-board kun . Årsagen til hver placering er det bindende budget - strøm, hukommelse eller latenstid.
| arbejdsbyrde | Placement | Bindende begrænsning | Hvorfor |
|---|---|---|---|
| Motorstyringssløjfe (500 Hz–1 kHz) | Altid ombord | Latens (< 1 ms) | Et netværkshop er 100–10000 gange loopbudgettet. Ingen undtagelser. |
| Ledsikkerhedsreflekser / nødstop | Altid ombord | Latens (< 5 ms) | Samme grund; skal også virke, når LAN'et er nede. |
| IMU-sensorfusion | Altid ombord | Latens (< 5 ms) | Forsyner kontrolsløjfen direkte. |
| Stereo / RGB-D dybde | Altid ombord | Båndbredde + latenstid | Raw-kamerabåndbredden er for høj til at sende; dybdeoutputtet er lille, men nødvendigt hurtigt. |
| YOLO-klasse objektdetektion | Foretrukket ombord | Latens (10-30 ms refleksiv) | Passer til en Jetson med 30+ FPS. Ingen grund til at netværke den. |
| Wake-word detektion | Foretrukket ombord | Strøm + latenstid | Altid tændt, sub-watt på QRB eller Hailo. Off-board bruger netværksbåndbredde 24/7. |
| Whisper-klasse STT (lille) | Enten | Latenstolerance | 100-250 ms på Jetson AGX Orin. Off-board er 30-80 ms på en 5090. Brugeren kan ikke se det. |
| Lille LLM (≤ 8B Q4) til dialog | Enten | Latens vs. samtidighed | 15-25 tok/s på Orin AGX, 80-150 tok/s på en 5090. Off-board vinder, hvis du har brug for skalering. |
| VLM 3B Q4 (scenetekstning) | Foretrukket ombord | Strøm + latenstid | Passer nemt til Orin, intet netværk nødvendigt, ~10 FPS brugbar. |
| VLM 7B Q4 (Qwen2.5-VL, OpenVLA) | Enten | Effekt vs. billedhastighed | Orin AGX kører 5-8 FPS ved 30 W. Kentino AI kører 30+ FPS. Vælg pr. opgave. |
| VLM 32B Q4 | Foretrukket eksternt (Thor: marginalt indbygget) | Hukommelse + strøm | Passer ikke til Orin AGX. Marginal på Thor 128 GB. Komfortabel på Kentino AI 96. |
| VLM 70B+ Q4 | Kun eksternt | Hukommelse | 45-50 GB vægte + 10-20 GB kV. Intet indbygget modul understøtter dette i 2026. |
| Bevægelsesplanlægger (kort horisont, < 1 s) | Foretrukket ombord | Latency | Tæt sløjfe med kontrol. Lokalt er det rigtige svar. |
| Bevægelsesplanlægger (lang horisont, multi-s) | Foretrukket eksternt | Hukommelse + modelstørrelse | VLM eller diffusionsbaserede, stor kontekst, off-board-gevinster. |
| Scenehukommelse / RAG | Kun eksternt | Vedholdenhed + hukommelse | Skal overleve robottens genstart; Vector Store ønsker rigtig lagerplads og CPU RAM. |
| Multikamera VLM-fusion (3-5 streams) | Kun eksternt | Hukommelse + beregning | Batching på tværs af kameraer kræver en server med flere GPU'er. |
| Finjustering / LoRA-træning | Kun eksternt | Hukommelse + strøm | 2–5× inferenshukommelse, vedvarende kW-klasseeffekt. Sker ikke på et batteri. |
| Fuld forberedende træning | Kun eksternt | Plads til ikke engang én server | Multi-node-territorium. Se K-sporet. |
| Isaac Sim-politikiteration | Kun eksternt | GPU-rendering + RL-gennemstrømning | I sagens natur en serverarbejdsbelastning. |
Tre aflæsninger af denne tabel er værd at fremhæve.
"Altid on-board"-rækkerne er fysik. Ingen båndbredde fastsætter en kontrolløkke, der kræver 1 kHz respons. Disse flytter sig aldrig, uanset hvor god netværks- eller off-board-beregningen bliver.
"Enten"-rækkerne er der, hvor den egentlige tekniske vurdering finder sted. De fleste af de interessante afvejninger findes her. Om en 7B VLM kører indbygget eller eksternt, bestemmer en reel del af systemets opførsel. Der er intet globalt rigtigt svar.
Rækkerne med "kun off-board" bevæger sig langsomt. En 72B-model vil sandsynligvis stadig kun være off-board i 2027. En 32B-model vil blive ombord i takt med at Thor bliver sendt i volumen. Grænsen for "hvad der passer til enheden" rykker cirka én modelstørrelsesklasse frem hver 18.-24. måned.
Kortlægning af latenstidsniveau
Firelags latenstidsbudgettet fra I01 knyttes direkte til placering:
| dyr | budget | Placement |
|---|---|---|
| Reaktiv kontrol | <10 ms | Kun ombord. Punktum. |
| Refleksiv opfattelse | 10-50 ms | Ombord (alene LAN tur/retur tærer på budgettet) |
| Deliberativ planlægning | 100 ms – 1 sek. | Enten. LAN virker, det indbyggede virker. |
| Strategisk ræsonnement | 1 s – multi-s | Enten vinder off-board ofte på modelkvalitet. |
De to midterste niveauer er, hvor de virkelige arkitekturbeslutninger ligger. En refleksiv arbejdsbelastning, der kun passer ind på 50 ms, kan måske passe off-board over et kablet LAN (0.5 ms transit + 40 ms inferens + 0.5 ms back = 41 ms), men sprænge budgettet i forhold til Wi-Fi 6E under belastning (8 ms × 2 + 40 ms = 56 ms, plus jitter). Derfor er kablede tethers vigtige under udvikling: de lader dig se, om en arbejdsbelastning grundlæggende passer off-board, før du kæmper med det trådløse netværk.
Netværksvirkelighed
Off-board fungerer kun, hvis netværket gør det. De faktiske tal:
| Link | Median RTT | P99 RTT | Jitter under belastning |
|---|---|---|---|
| Kablet 2.5 / 10 GbE-tether | 0.2-0.5 ms | 0.5-1 ms | Undertekster |
| Wi-Fi 6E, 6 GHz, synsfelt, dedikeret AP | 3-10 ms | 15-30 ms | Administrerbar |
| Wi-Fi 6/6E, delt 5 GHz, omstridt | 8-25 ms | 80-200 ms | Bad |
| Wi-Fi 6E under belastning (filoverførsel i samme SSID) | 10-40 ms | 200 ms – 2 sek. | Robot-brydende |
| Cellulær 5G mellembånd | 20-40 ms | 100-300 ms | Variabel |
| WAN til EU-cloud | 15–40 ms (median) | 80-300 ms | BGP-afhængig |
Til overvejende arbejdsbelastninger (budget på 100 ms – 1 s) er Wi-Fi 6E på et dedikeret SSID og et AP med frit synsfelt fint. Til refleksive arbejdsbelastninger (10-50 ms) er kablet det sikre svar, og Wi-Fi 6E er det heldige svar. Planlæg i overensstemmelse hermed: Hvis en robots opgave har refleksive eksterne komponenter, skal du designe med en kablet mulighed for udvikling og en backuptilstand, når Wi-Fi forringes.
Hybridmønsteret — hurtig/langsom opdeling
Det mønster, som de fleste seriøse implementeringer i 2026 konvergerer efter, er en hurtig/langsom opdelt VLM : en lille VLM on-board til øjeblikkelig feedback, en stor VLM off-board til velovervejede beslutninger, der begge forsyner den samme planlægger.
Betonform:
- 33 ms kadence pr. frame
- Forsyner både indbyggede og eksterne VLM-stier
- Qwen2.5-VL-7B på Jetson AGX Orin / Thor
- 5–10 Hz udgang
- Sceneoversigt + øjeblikkelig handling
- Fodrer det refleksive lag direkte
gRPC
- Qwen2.5-VL-72B på Kentino AI 96/256
- 1–3 Hz udgang
- Overvejet sceneargumentation + planjustering
- Feeder det deliberative lag, kan tilsidesætte det indbyggede
Hurtig/langsom opdeling: Indbygget 7B håndterer øjeblikkelig respons; ekstern 72B håndterer velovervejet ræsonnement og planopdateringer.
Den hurtige model håndterer "der er en person, der går imod mig, sæt farten ned". Den langsomme model håndterer "personen, der går imod mig, er operatøren, som bad mig om at holde pause, hvis de nærmede sig med det røde udklipsholder, og det er et rødt udklipsholder, så hold pause". Den hurtige model forpligter sig først til sikker adfærd; den langsomme model opgraderer den.
Migrationshistorien — hvad sker der ombord i 2026-2027
Tre kræfter komprimerer off-board-siden: Thor lander på volumen (2070 FP4 TFLOPS, 128 GB samlet hukommelse, 130 W envelope - et strukturelt spring fra Orin); VLM-effektiviteten fortsætter med at forbedres (en "god nok" opfattelse. VLM var 70B+ i 2024, er 32B i 2026 og vil sandsynligvis være 13B-20B i 2027); og spekulativ afkodning med små drafter-modeller giver dig mulighed for at levere stormodelkvalitet med lillemodel-latens.
Arbejdsbyrder, der mest sandsynligt vil migrere om bord i løbet af de næste 18 måneder: 7B-klasse scene VLM (allerede under flytning), 13B LLM-planlægger (Thor gør det komfortabelt), kortkontekst STT-LLM-TTS til stemme, domænespecifikke finjusterede 7B VLM'er.
Arbejdsbelastninger, der ikke migrerer: alt på 70B+, flådebaseret scenehukommelse, træning og simulering, multi-stream VLM-fusion. Disse forbliver off-board indtil minimum 2027. Hukommelsesbåndbredde og batteristrøm ændrer sig ikke så hurtigt.
To betonkonfigurationer
Enkelt G1 EDU, forskningslaboratorium. Indbygget AGX Orin kører ROS 2, YOLOv11-s ved 30 FPS, Whisper-distil STT og Qwen2.5-VL 7B INT4 ved 5-8 FPS (deliberativt). Off-board Kentino AI 96 (4× RTX 5090, 128 GB VRAM) kører vLLM med Qwen2.5-VL 72B og Qwen2.5 32B tekst-only, pgvector scene memory og Isaac Sim på inaktive GPU'er.
Lille flåde, 3 humanoider, Thor-klasse ombord. Hver enhed kører en Hailo-15 Vision SoC til altid-på multi-cam detektion, Whisper-small på enheden og Qwen2.5-VL 32B INT4 ved 10-15 FPS - indbygget, ikke længere marginal. Off-board Kentino AI 256 (8× RTX 5090, 256 GB VRAM) er vært for en delt Qwen2.5-VL 72B og Llama-3.1 70B til planlægning, et delt pgvektor-lager på tværs af alle tre robotter og to GPU'er reserveret til LoRA-finjustering natten over.
Hvor rene enkeltlagsimplementeringer fungerer
Rent on-board fungerer for firbenede dyr med smalle opgaver (perimeterpatrulje med YOLO + termisk kamera), telebetjente robotter (operatøren er planlæggeren, ingen VLM i loop), demo-/uddannelsesrobotter med de mindste modeller og enhver implementering uden netværk overhovedet (udendørs inspektion, fjerntliggende steder).
Ren cloud fungerer til robotassistenter, der kun bruger stemmestyring uden en lukket opfattelsesløjfe, prototyper hvor opsætningshastigheden slår alt, og implementeringer, hvor dataene alligevel bevidst sendes til en cloud-arbejdsbelastning.
Hybrid er svaret på alt derimellem – hvilket er cirka 90 % af seriøs robotteknologi i 2026. Hvis du bygger noget med VLM-in-the-loop-opfattelse, ender du med begge niveauer. Planlæg det fra dag ét.
Beslutningsflow
Når du skalerer en implementering:
- Angiv arbejdsbyrderne. Motorisk kontrol, perception, STT, LLM, VLM, planlægning, hukommelse, træning. Vær eksplicit.
- Mærk hver med et latenstidsniveau og en hukommelsesklasse (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
- Anvend matricen ovenfor for at få en first-pass placering.
- Revision ombord mod robottens faktiske SoC og termiske budget. En G1 med Orin NX er en anden maskine end en T1 med AGX Orin eller en fremtidig Thor-platform.
- Revider eksternt mod det Kentino AI-niveau, du har råd til. Kentino AI 96 er gulvet til én robot, der udfører seriøst arbejde; Kentino AI 256 er gulvet til en flåde eller ethvert andet træningsbehov.
- Revider netværket. Kablet tether til udvikling, dedikeret Wi-Fi 6E SSID til produktion. Hvis dit refleksive lag krydser netværket, skal du planlægge et kablet eller et fallback med en graceful-degrade-funktion.
- Planlæg migrering. Når Thor sendes ind på din platform, hvilke arbejdsbelastninger flyttes så ombord? Abstraher gRPC-grænsen nu, så migreringen er en ændring i implementeringen, ikke en omskrivning.
De opfølgende artikler ( R05 , I02, I05) går i dybden med de dele, der er skitseret her. Placeringsbeslutningerne i denne artikel er det stillads, som alt andet hænger på.
Den ærlige vurdering: 90 % af seriøse robotimplementeringer i 2026 kræver begge niveauer. On-board dimensioneres til sikkerhed, refleks og opfattelse af små modeller. Off-board dimensioneres til VLM-in-the-loop, scenehukommelse, planlægning og træning. Implementeringer på ét niveau fungerer til snævre anvendelsesscenarier – og kun disse.
Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.