Look Ma, No Labels
From Robust Perception to Self-Supervised Representation Learning for Autonomous Driving
Tid: Fr 2026-10-16 kl 10.00
Plats: Kollegiesalen, Teknikringen 14
Språk: Engelska
Respondent: Maciej Wozniak , Robotik, perception och lärande
Opponent: Ph.D. Andrei Bursuc, Valeo.ai, Paris, France
Handledare: Professor Patric Jensfelt, Robotik, perception och lärande; Associate professor André Tiago Abelho Pereira, Tal, musik och hörsel
QC 20260923
Abstract
Industrin för autonom körning växer snabbt, och även om alla problem för en utomstående betraktare kan verka lösta återstår många. I denna avhandling fokuserar vi på det autonoma fordonets "hjärna", det vill säga perceptionspipelinen.
Perceptionspipelines för autonom körning kan delas upp i en backbone, som avbildar rå sensordata till en särdragsrepresentation, och uppgiftsspecifika huvuden (task heads), som avkodar den representationen till detektioner, segmentering, occupancy-rutnät eller trajektorier. Varje efterföljande uppgift ärver egenskaperna hos denna representation: om den är bräcklig, överanpassad till träningsfördelningen eller känslig för sensordegradering kommer hela pipelinen att fallera. Avhandlingen undersöker hur tre faktorer tillsammans bestämmer representationens kvalitet: backbone-arkitekturen, den träningssignal (supervision) som används för att träna den, samt träningsdatans omfattning och variation. Huvudargumentet är att representationen är det beslut som ger störst utväxling när data inte kan skalas fritt (under sensor- och kostnadsbegränsningar, begränsad annotering eller distributionsskifte), och att utväxlingen förskjuts från arkitektur till valet av träningsstrategi i takt med att mängden omärkt data växer.
Avhandlingen utvecklar detta argument i tre steg. För det första visas att robusthet avgörs inuti backbonen snarare än i sensoruppsättningen eller i uppgiftshuvudet. För det andra behandlas fallet där driftsättningsförhållandena skiljer sig från träningsförhållandena, där det visas att självövervakade mål som utnyttjar den naturliga korrespondensen mellan LiDAR- och kameraobservationer överför kunskap mellan sensorer, domäner och efterföljande uppgifter utan annoteringar. För det tredje undersöks hur representationer som lärts från bilddata i webbskala kan destilleras in i 3D-backbones anpassade för autonom körning.
Sammantaget indikerar resultaten att noggrant utformade arkitekturer och självövervakade mål, snarare än ytterligare annoterad köringsdata, är den praktiska vägen till robusta perceptionssystem.