:秒級生成 3D 場景,Transformer 開啟空間智能新征程)
從 2D 像素到 3D 場景 Query影溯推動三維內(nèi)容生產(chǎn)變革影溯正在嘗試把三維內(nèi)容生產(chǎn)推向可規(guī)?;{(diào)用的新階段。用手機圍著小擺件、咖啡店、臥室等拍攝幾張照片幾秒后它們就能從二維照片中「立」起來變成可把玩、可自由探索的 3D 內(nèi)容。這款名為 Crystal 空間相機的 App是影溯將最新研究成果做成的免費 3D 捕捉工具讓人們能輕松體驗拍攝 3D 空間照片。開源 QuerySplat 技術(shù)加速 3D 內(nèi)容生產(chǎn)規(guī)?;八菡介_源前饋式 3D Gaussian Splatting 生成技術(shù) QuerySplat只需輸入少量不同視角、無需提供相機位姿的圖片即可在一次前向推理中秒級生成可自由切換視角的 3D 場景。在大規(guī)模 DL3DV - Evaluation 基準的 2、4、12 視圖設(shè)置中Topos - Lite 在 PSNR 和 SSIM 指標上均取得最優(yōu)結(jié)果在更關(guān)注感知相似度的 LPIPS 指標上也在 2 視圖和 4 視圖設(shè)置中排名第一。影溯開源 QuerySplat希望推動前饋式 3D 生成走向行業(yè)共同驗證、迭代的技術(shù)基礎(chǔ)加速 3D 內(nèi)容生產(chǎn)規(guī)模化。Topos - Lite改變模型組織三維空間方式Topos - Lite 最值得關(guān)注的是改變了模型組織三維空間的方式。過去不少前饋式 3DGS 方法采用像素對齊范式存在先天問題如不同視角像素誤差會導(dǎo)致三維空間沖突。而 Topos - Lite 采用 Query - based 思路讓一組可學(xué)習(xí)的 Query 充當「場景級位置」使 Transformer 熟悉的機制承擔起組織三維場景的角色。它只需輸入隨手拍照片就能快速生成 3D Gaussian 場景生成結(jié)果主體輪廓更完整紋理更清晰場景結(jié)構(gòu)更干凈穩(wěn)定。與傳統(tǒng)方法相比前饋模型改變了成本結(jié)構(gòu)對普通用戶來說拍攝圖片更少、無需手動標定、等待時間壓縮到秒級。Topos - Lite 在 DL3DV - Evaluation 的多種稀疏視圖設(shè)置中取得當前最強整體表現(xiàn)還提供了容量擴展接口。其性能處于早期研究階段未來品質(zhì)與精細度將持續(xù)躍升有望在端側(cè)高效運行。下一代人工智能需理解空間在影溯看來過去十年人工智能主要學(xué)習(xí)人類表達的世界下一階段需理解世界本身。二維圖片和視頻是三維世界的投影模型從二維像素學(xué)習(xí)需處理諸多變化和冗余信息。引入三維能將「世界是什么」和「我們怎樣看見世界」分開讓模型學(xué)習(xí)更緊湊、穩(wěn)定的空間表征??臻g智能不是 AI 的邊緣分支而是從數(shù)字智能走向物理智能必須掌握的基本能力。技術(shù)突破背后的近二十年積累空間智能發(fā)展需解決諸多工程細節(jié)問題影溯核心團隊在 SLAM、三維視覺和空間智能領(lǐng)域有近二十年積累。創(chuàng)始人章國鋒教授長期追問機器如何理解真實三維世界他本科和研究生均學(xué)計算機專業(yè)研究生時加入鮑虎軍教授團隊進入三維視覺領(lǐng)域。他完整經(jīng)歷了三維技術(shù)的發(fā)展在高校研究和商湯工作的經(jīng)歷使他能將前沿算法轉(zhuǎn)化為產(chǎn)業(yè)動能。聯(lián)合創(chuàng)始人劉浩敏博士及其團隊的工程化能力進一步放大了這些成果。影溯團隊結(jié)構(gòu)特別既有長期積累的成員也有年輕研究者參與核心課題。Topos - Lite 的關(guān)鍵突破由團隊中的「00 后」研究員主導(dǎo)完成。三維技術(shù)先入真實場景再成機器理解世界的數(shù)據(jù)空間智能終局雖大但三維技術(shù)可先降低生產(chǎn)門檻滿足人們的記錄、展示與創(chuàng)作需求。在空間記錄方面三維生成簡單快速低成本可將照片變成「空間照片」記錄生活的媒介可能隨之改變。在空間展示與遠程體驗領(lǐng)域快速生成可瀏覽的三維場景能讓相關(guān)行業(yè)有更直觀的表達方式降低成本。在生成式內(nèi)容生產(chǎn)方面能讓二維生成、視頻制作和三維場景建立更直接連接。對機器人而言三維世界是其仿真、驗證和學(xué)習(xí)的訓(xùn)練場。先讓三維技術(shù)進入真實場景再用數(shù)據(jù)訓(xùn)練空間智能是三維數(shù)據(jù)走向規(guī)?;默F(xiàn)實路徑。終局讓智能真正進入空間對影溯而言世界模型是技術(shù)路徑空間智能是長期方向。它希望構(gòu)建能在現(xiàn)實世界驗證空間理解能力的智能。Topos - Lite 解決了基礎(chǔ)現(xiàn)實問題讓 Transformer 從少量二維觀測中組織出三維場景也讓影溯的長期判斷落實到技術(shù)結(jié)果上。未來空間智能架構(gòu)尚無定論但空間理解是機器進入真實世界繞不開的能力影溯希望參與建設(shè)面向物理智能的基礎(chǔ)設(shè)施。Topos - Lite 證明三維場景能更快、更清晰生成且可開放調(diào)用Transformer 的處理對象延伸到連續(xù)三維空間。