On-device vs. off-device computing for robotter

Enhver arbejdsbelastning på en robot findes på et af to steder: on-board, via batteriet og brystblæserne, eller off-board, på en vægforsynet server ét LAN-hop væk. Det svære spørgsmål er ikke, om du har brug for begge dele - det har du næsten altid - men hvilken arbejdsbelastning der skal hvorhen, og hvorfor . R08 argumenterer for, at der overhovedet findes et dedikeret kantniveau. Denne artikel handler om beslutningen pr. arbejdsbelastning: motorstyring her, VLM der, STT afhænger, og så videre.

Rammen er præget af meninger. Der er et rigtigt svar pr. arbejdsbyrde, og det rigtige svar ændrer sig, efterhånden som den indbyggede siliciumproduktion indhenter. Vi vil sige, hvilken vej hver brik bevæger sig i 2026-2027.

De to budgetter, der bestemmer alt

En arbejdsbelastning kan køre indbygget, hvis og kun hvis den passer ind i to budgetter samtidigt: strømforbrug og hukommelse . Latens er den tredje begrænsning, men latens fortæller dig normalt, hvilken vej du skal skubbe en arbejdsbelastning, der passer, ikke om den overhovedet passer.

Strømforbrug på en humanoid. En humanoid på 30-50 kg bærer 700-900 Wh batteri. Vedvarende gang trækker 200-500 W fra aktuatorerne, med toppe på 800 W+ under dynamisk bevægelse. Stillestående og tænkning trækker 80-150 W fra aktuatorerne (holdemoment er billigt, holdestilling koster). Det efterlader cirka 60-120 W til alt andet - beregning, sensorer, køleblæsere, radio - hvis du ønsker en brugbar to-timers driftstid. Beregningsbudgettet inden for dette område er 30-80 W vedvarende. At brænde Jetson ved MAX_N (60 W) hele tiden halverer robottens driftstid. Dette er ikke-forhandlingsbart fysik, ikke et designvalg.

Hukommelsesbudget. En Jetson AGX Orin 64 GB er 64 GB LPDDR5, der deles mellem CPU'en og GPU'en . Fratræk operativsystemet (4-6 GB), ROS 2 og producentens SDK (2-4 GB), perceptionsbuffere (2-4 GB til stereodybde og punktskyer) og eventuel applikationskode. Det realistiske LLM/VLM-brugelige budget er 40-48 GB. På et Jetson Thor 128 GB-modul stiger loftet til ~96 GB brugbart. På Orin NX 16 GB falder det til ~8-10 GB brugbart - nok til én lille model.

Off-board er begge budgetter forskellige problemer. En Kentino AI 96 (4× RTX 5090) har 128 GB dedikeret VRAM og 1.0-1.5 kW GPU-kraft under vægmontering. En Kentino AI 256 (8× RTX 5090) fordobler begge dele. Strøm og hukommelse er simpelthen ikke længere begrænsninger - du bytter dem i stedet for kapitaludgifter, rum-HVAC og kabelbaseret netværk.

Indbygget silicium, virkeligheden i 2026

De indbyggede muligheder, der rent faktisk leverer seriøse humanoider og firbenede dyr i dag:

SoC INT8 TOPPER (sparsom) Brugbar hukommelse Power kuvert Hvad den kan køre
Jetson Orin NX 16 GB 100 ~10 GB delt 10-25 W YOLO, lille VLM 3B Q4, vækkeord
Jetson AGX Orin 64 GB 275 ~40 GB delt 15-60 W YOLO, VLM 7B Q4 til brugbare priser, 13B LLM
Jetson AGX Thor 128 GB (2026) 2070 FP4 TFLOPS ~96 GB delt 40-130 W VLM 32B Q4 med ekstra plads, dobbeltstrømsoplevelse
Snapdragon 8 Gen 3 / QRB-klasse 45-75 ~6-10 GB delt 5-15 W Stemme, vækkeord, let CV
Hailo-8 (M.2-tilføjelsesprogram) 26 INT8 TOPS 2-4 GB indbygget hukommelse 2.5 W typisk Aflastning af visionsrørledning, MobileNet/YOLO
Hailo-15 (vision-SoC) 20 TOPS Rørledningsbeboer 2-5 W Altid aktivt multikamera CV
Intel N97 / i7-1370P co-processor n/a (CPU + iGPU) DDR5-vært 6-45 W Højniveauorkestrering, ROS 2, lim

Thor er et skridtskifte, ikke en iteration. 128 GB hukommelsesloftet og de FP4-native Blackwell tensorkerner flytter den indbyggede grænse fra "7B VLM, smerteligt nok" til "32B VLM, nyttigt nok" på én generation. Arbejdsbelastninger, der strukturelt var off-board i 2025 - mellemstore VLM'er, kontinuerlig scenetekstning, mellemstore LLM-planlæggere - bliver indbyggede kandidater i 2026, hvis robottens termiske løsning kan opretholde 100-130 W.

Hailo og den dedikerede NPU-klasse er ikke LLM-acceleratorer. De er vision-pipeline-aflastning: hold den primære Jetson fri til den større model, kør det altid tændte kamera CV (objektdetektion, sporing, grundlæggende VLM-lite) på en 3 W chip.

Snapdragon QRB-klassen er svaret på stemmeorienterede robotter — wake-word, beamforming, STT — hvor en Jetson er overkill, og en Cortex-M er for lille. Nyttig, smal, stadig mere almindelig.

Off-board: Kentino AI-niveauet som reference

Det eksterne mål, der refereres til i hele denne serie, er Kentino AI-serien – vægdrevet, 4U- eller 5U-rack, 4 eller 8 GPU'er på EPYC eller Xeon, på en 10 GbE-switch ét hop fra robotten. De tre niveauer, der er vigtige for robotteknologi:

dyr GPU'er Samlet VRAM Vedvarende kraft Største realistiske VLM (INT4)
Kentino AI 64/96 (4-GPU) 4× RTX 5090 eller 4× Pro 6000 128-384 GB 1.8-2.4 kW 72B med plads til KV-cache
Kentino AI 128 (4× Pro 6000 Blackwell) 4× RTX Pro 6000 96 GB 384 DK 2.0-2.6 kW 72B med fuld kontekst
Kentino AI 256 (8-GPU) 8× RTX 5090 eller 8× Pro 6000 256-768 GB 3.5-4.5 kW 70B + 32B + 7B samtidigt

Beslutningsmatricen

Enhver robotarbejdsbelastning sorteres tydeligt i en af ​​fem kategorier: altid on-board , on-board foretrukket , enten , off-board foretrukket , off-board kun . Årsagen til hver placering er det bindende budget - strøm, hukommelse eller latenstid.

arbejdsbyrde Placement Bindende begrænsning Hvorfor
Motorstyringssløjfe (500 Hz–1 kHz) Altid ombord Latens (< 1 ms) Et netværkshop er 100–10000 gange loopbudgettet. Ingen undtagelser.
Ledsikkerhedsreflekser / nødstop Altid ombord Latens (< 5 ms) Samme grund; skal også virke, når LAN'et er nede.
IMU-sensorfusion Altid ombord Latens (< 5 ms) Forsyner kontrolsløjfen direkte.
Stereo / RGB-D dybde Altid ombord Båndbredde + latenstid Raw-kamerabåndbredden er for høj til at sende; dybdeoutputtet er lille, men nødvendigt hurtigt.
YOLO-klasse objektdetektion Foretrukket ombord Latens (10-30 ms refleksiv) Passer til en Jetson med 30+ FPS. Ingen grund til at netværke den.
Wake-word detektion Foretrukket ombord Strøm + latenstid Altid tændt, sub-watt på QRB eller Hailo. Off-board bruger netværksbåndbredde 24/7.
Whisper-klasse STT (lille) Enten Latenstolerance 100-250 ms på Jetson AGX Orin. Off-board er 30-80 ms på en 5090. Brugeren kan ikke se det.
Lille LLM (≤ 8B Q4) til dialog Enten Latens vs. samtidighed 15-25 tok/s på Orin AGX, 80-150 tok/s på en 5090. Off-board vinder, hvis du har brug for skalering.
VLM 3B Q4 (scenetekstning) Foretrukket ombord Strøm + latenstid Passer nemt til Orin, intet netværk nødvendigt, ~10 FPS brugbar.
VLM 7B Q4 (Qwen2.5-VL, OpenVLA) Enten Effekt vs. billedhastighed Orin AGX kører 5-8 FPS ved 30 W. Kentino AI kører 30+ FPS. Vælg pr. opgave.
VLM 32B Q4 Foretrukket eksternt (Thor: marginalt indbygget) Hukommelse + strøm Passer ikke til Orin AGX. Marginal på Thor 128 GB. Komfortabel på Kentino AI 96.
VLM 70B+ Q4 Kun eksternt Hukommelse 45-50 GB vægte + 10-20 GB kV. Intet indbygget modul understøtter dette i 2026.
Bevægelsesplanlægger (kort horisont, < 1 s) Foretrukket ombord Latency Tæt sløjfe med kontrol. Lokalt er det rigtige svar.
Bevægelsesplanlægger (lang horisont, multi-s) Foretrukket eksternt Hukommelse + modelstørrelse VLM eller diffusionsbaserede, stor kontekst, off-board-gevinster.
Scenehukommelse / RAG Kun eksternt Vedholdenhed + hukommelse Skal overleve robottens genstart; Vector Store ønsker rigtig lagerplads og CPU RAM.
Multikamera VLM-fusion (3-5 streams) Kun eksternt Hukommelse + beregning Batching på tværs af kameraer kræver en server med flere GPU'er.
Finjustering / LoRA-træning Kun eksternt Hukommelse + strøm 2–5× inferenshukommelse, vedvarende kW-klasseeffekt. Sker ikke på et batteri.
Fuld forberedende træning Kun eksternt Plads til ikke engang én server Multi-node-territorium. Se K-sporet.
Isaac Sim-politikiteration Kun eksternt GPU-rendering + RL-gennemstrømning I sagens natur en serverarbejdsbelastning.

Tre aflæsninger af denne tabel er værd at fremhæve.

"Altid on-board"-rækkerne er fysik. Ingen båndbredde fastsætter en kontrolløkke, der kræver 1 kHz respons. Disse flytter sig aldrig, uanset hvor god netværks- eller off-board-beregningen bliver.

"Enten"-rækkerne er der, hvor den egentlige tekniske vurdering finder sted. De fleste af de interessante afvejninger findes her. Om en 7B VLM kører indbygget eller eksternt, bestemmer en reel del af systemets opførsel. Der er intet globalt rigtigt svar.

Rækkerne med "kun off-board" bevæger sig langsomt. En 72B-model vil sandsynligvis stadig kun være off-board i 2027. En 32B-model vil blive ombord i takt med at Thor bliver sendt i volumen. Grænsen for "hvad der passer til enheden" rykker cirka én modelstørrelsesklasse frem hver 18.-24. måned.

Kortlægning af latenstidsniveau

Firelags latenstidsbudgettet fra I01 knyttes direkte til placering:

dyr budget Placement
Reaktiv kontrol <10 ms Kun ombord. Punktum.
Refleksiv opfattelse 10-50 ms Ombord (alene LAN tur/retur tærer på budgettet)
Deliberativ planlægning 100 ms – 1 sek. Enten. LAN virker, det indbyggede virker.
Strategisk ræsonnement 1 s – multi-s Enten vinder off-board ofte på modelkvalitet.

De to midterste niveauer er, hvor de virkelige arkitekturbeslutninger ligger. En refleksiv arbejdsbelastning, der kun passer ind på 50 ms, kan måske passe off-board over et kablet LAN (0.5 ms transit + 40 ms inferens + 0.5 ms back = 41 ms), men sprænge budgettet i forhold til Wi-Fi 6E under belastning (8 ms × 2 + 40 ms = 56 ms, plus jitter). Derfor er kablede tethers vigtige under udvikling: de lader dig se, om en arbejdsbelastning grundlæggende passer off-board, før du kæmper med det trådløse netværk.

Netværksvirkelighed

Off-board fungerer kun, hvis netværket gør det. De faktiske tal:

Link Median RTT P99 RTT Jitter under belastning
Kablet 2.5 / 10 GbE-tether 0.2-0.5 ms 0.5-1 ms Undertekster
Wi-Fi 6E, 6 GHz, synsfelt, dedikeret AP 3-10 ms 15-30 ms Administrerbar
Wi-Fi 6/6E, delt 5 GHz, omstridt 8-25 ms 80-200 ms Bad
Wi-Fi 6E under belastning (filoverførsel i samme SSID) 10-40 ms 200 ms – 2 sek. Robot-brydende
Cellulær 5G mellembånd 20-40 ms 100-300 ms Variabel
WAN til EU-cloud 15–40 ms (median) 80-300 ms BGP-afhængig

Til overvejende arbejdsbelastninger (budget på 100 ms – 1 s) er Wi-Fi 6E på et dedikeret SSID og et AP med frit synsfelt fint. Til refleksive arbejdsbelastninger (10-50 ms) er kablet det sikre svar, og Wi-Fi 6E er det heldige svar. Planlæg i overensstemmelse hermed: Hvis en robots opgave har refleksive eksterne komponenter, skal du designe med en kablet mulighed for udvikling og en backuptilstand, når Wi-Fi forringes.

Hybridmønsteret — hurtig/langsom opdeling

Det mønster, som de fleste seriøse implementeringer i 2026 konvergerer efter, er en hurtig/langsom opdelt VLM : en lille VLM on-board til øjeblikkelig feedback, en stor VLM off-board til velovervejede beslutninger, der begge forsyner den samme planlægger.

Betonform:

Kameraramme — 30 FPS
  • 33 ms kadence pr. frame
  • Forsyner både indbyggede og eksterne VLM-stier

Indbygget VLM 7B Q4
  • Qwen2.5-VL-7B på Jetson AGX Orin / Thor
  • 5–10 Hz udgang
  • Sceneoversigt + øjeblikkelig handling
  • Fodrer det refleksive lag direkte

gRPC
Ekstern VLM 72B Q4
  • Qwen2.5-VL-72B på Kentino AI 96/256
  • 1–3 Hz udgang
  • Overvejet sceneargumentation + planjustering
  • Feeder det deliberative lag, kan tilsidesætte det indbyggede

Hurtig/langsom opdeling: Indbygget 7B håndterer øjeblikkelig respons; ekstern 72B håndterer velovervejet ræsonnement og planopdateringer.

Den hurtige model håndterer "der er en person, der går imod mig, sæt farten ned". Den langsomme model håndterer "personen, der går imod mig, er operatøren, som bad mig om at holde pause, hvis de nærmede sig med det røde udklipsholder, og det er et rødt udklipsholder, så hold pause". Den hurtige model forpligter sig først til sikker adfærd; den langsomme model opgraderer den.

Migrationshistorien — hvad sker der ombord i 2026-2027

Tre kræfter komprimerer off-board-siden: Thor lander på volumen (2070 FP4 TFLOPS, 128 GB samlet hukommelse, 130 W envelope - et strukturelt spring fra Orin); VLM-effektiviteten fortsætter med at forbedres (en "god nok" opfattelse. VLM var 70B+ i 2024, er 32B i 2026 og vil sandsynligvis være 13B-20B i 2027); og spekulativ afkodning med små drafter-modeller giver dig mulighed for at levere stormodelkvalitet med lillemodel-latens.

Arbejdsbyrder, der mest sandsynligt vil migrere om bord i løbet af de næste 18 måneder: 7B-klasse scene VLM (allerede under flytning), 13B LLM-planlægger (Thor gør det komfortabelt), kortkontekst STT-LLM-TTS til stemme, domænespecifikke finjusterede 7B VLM'er.

Arbejdsbelastninger, der ikke migrerer: alt på 70B+, flådebaseret scenehukommelse, træning og simulering, multi-stream VLM-fusion. Disse forbliver off-board indtil minimum 2027. Hukommelsesbåndbredde og batteristrøm ændrer sig ikke så hurtigt.

To betonkonfigurationer

Enkelt G1 EDU, forskningslaboratorium. Indbygget AGX Orin kører ROS 2, YOLOv11-s ved 30 FPS, Whisper-distil STT og Qwen2.5-VL 7B INT4 ved 5-8 FPS (deliberativt). Off-board Kentino AI 96 (4× RTX 5090, 128 GB VRAM) kører vLLM med Qwen2.5-VL 72B og Qwen2.5 32B tekst-only, pgvector scene memory og Isaac Sim på inaktive GPU'er.

Lille flåde, 3 humanoider, Thor-klasse ombord. Hver enhed kører en Hailo-15 Vision SoC til altid-på multi-cam detektion, Whisper-small på enheden og Qwen2.5-VL 32B INT4 ved 10-15 FPS - indbygget, ikke længere marginal. Off-board Kentino AI 256 (8× RTX 5090, 256 GB VRAM) er vært for en delt Qwen2.5-VL 72B og Llama-3.1 70B til planlægning, et delt pgvektor-lager på tværs af alle tre robotter og to GPU'er reserveret til LoRA-finjustering natten over.

Hvor rene enkeltlagsimplementeringer fungerer

Rent on-board fungerer for firbenede dyr med smalle opgaver (perimeterpatrulje med YOLO + termisk kamera), telebetjente robotter (operatøren er planlæggeren, ingen VLM i loop), demo-/uddannelsesrobotter med de mindste modeller og enhver implementering uden netværk overhovedet (udendørs inspektion, fjerntliggende steder).

Ren cloud fungerer til robotassistenter, der kun bruger stemmestyring uden en lukket opfattelsesløjfe, prototyper hvor opsætningshastigheden slår alt, og implementeringer, hvor dataene alligevel bevidst sendes til en cloud-arbejdsbelastning.

Hybrid er svaret på alt derimellem – hvilket er cirka 90 % af seriøs robotteknologi i 2026. Hvis du bygger noget med VLM-in-the-loop-opfattelse, ender du med begge niveauer. Planlæg det fra dag ét.

Beslutningsflow

Når du skalerer en implementering:

  1. Angiv arbejdsbyrderne. Motorisk kontrol, perception, STT, LLM, VLM, planlægning, hukommelse, træning. Vær eksplicit.
  2. Mærk hver med et latenstidsniveau og en hukommelsesklasse (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
  3. Anvend matricen ovenfor for at få en first-pass placering.
  4. Revision ombord mod robottens faktiske SoC og termiske budget. En G1 med Orin NX er en anden maskine end en T1 med AGX Orin eller en fremtidig Thor-platform.
  5. Revider eksternt mod det Kentino AI-niveau, du har råd til. Kentino AI 96 er gulvet til én robot, der udfører seriøst arbejde; Kentino AI 256 er gulvet til en flåde eller ethvert andet træningsbehov.
  6. Revider netværket. Kablet tether til udvikling, dedikeret Wi-Fi 6E SSID til produktion. Hvis dit refleksive lag krydser netværket, skal du planlægge et kablet eller et fallback med en graceful-degrade-funktion.
  7. Planlæg migrering. Når Thor sendes ind på din platform, hvilke arbejdsbelastninger flyttes så ombord? Abstraher gRPC-grænsen nu, så migreringen er en ændring i implementeringen, ikke en omskrivning.

De opfølgende artikler ( R05 , I02, I05) går i dybden med de dele, der er skitseret her. Placeringsbeslutningerne i denne artikel er det stillads, som alt andet hænger på.

Den ærlige vurdering: 90 % af seriøse robotimplementeringer i 2026 kræver begge niveauer. On-board dimensioneres til sikkerhed, refleks og opfattelse af små modeller. Off-board dimensioneres til VLM-in-the-loop, scenehukommelse, planlægning og træning. Implementeringer på ét niveau fungerer til snævre anvendelsesscenarier – og kun disse.


Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.

Tilbage til bloggen