的設(shè)計(jì)與實(shí)現(xiàn))
一、選題背景與研究意義隨著國(guó)民經(jīng)濟(jì)的快速發(fā)展與居民生活水平的不斷提高旅游已成為人們休閑娛樂(lè)的重要方式。移動(dòng)互聯(lián)網(wǎng)與在線(xiàn)旅游平臺(tái)的蓬勃發(fā)展使得旅游信息呈爆炸式增長(zhǎng)游客在面對(duì)海量的景點(diǎn)、酒店、線(xiàn)路等信息時(shí)往往面臨信息過(guò)載的問(wèn)題難以快速找到符合自身偏好的旅游目的地。個(gè)性化推薦技術(shù)作為解決信息過(guò)載的有效手段在電商、影視、音樂(lè)等領(lǐng)域已取得成功應(yīng)用但在旅游領(lǐng)域的應(yīng)用仍面臨數(shù)據(jù)規(guī)模大、維度復(fù)雜、時(shí)空特征強(qiáng)等獨(dú)特挑戰(zhàn)。大數(shù)據(jù)技術(shù)的成熟為解決旅游推薦中的數(shù)據(jù)規(guī)模問(wèn)題提供了可行路徑。通過(guò)Hadoop分布式存儲(chǔ)架構(gòu)實(shí)現(xiàn)海量旅游數(shù)據(jù)的可靠存儲(chǔ)借助Spark內(nèi)存計(jì)算框架實(shí)現(xiàn)協(xié)同過(guò)濾推薦算法的并行化處理利用Python生態(tài)下的機(jī)器學(xué)習(xí)工具鏈完成推薦模型的訓(xùn)練與優(yōu)化結(jié)合SpringBoot后端框架與Vue前端框架構(gòu)建完整的推薦系統(tǒng)能夠?yàn)槊课挥慰吞峁┝可矶ㄖ频穆糜涡畔⑼扑]服務(wù)。這不僅能夠提升游客的旅行體驗(yàn)也有助于旅游平臺(tái)提升用戶(hù)粘性與運(yùn)營(yíng)效率。本研究以旅游景點(diǎn)與用戶(hù)行為數(shù)據(jù)為研究對(duì)象設(shè)計(jì)并實(shí)現(xiàn)一套基于SpringBoot的旅游信息推薦系統(tǒng)探索分布式計(jì)算框架下協(xié)同過(guò)濾推薦算法在旅游場(chǎng)景下的應(yīng)用效果為大數(shù)據(jù)專(zhuān)業(yè)學(xué)生掌握前后端全棧開(kāi)發(fā)與大數(shù)據(jù)分布式處理的工程實(shí)踐提供完整的項(xiàng)目范本。二、數(shù)據(jù)分析與數(shù)據(jù)來(lái)源2.1 數(shù)據(jù)來(lái)源溯源本研究的數(shù)據(jù)來(lái)源主要包括三個(gè)方面第一旅游景點(diǎn)基礎(chǔ)數(shù)據(jù)。通過(guò)Python爬蟲(chóng)技術(shù)從攜程、馬蜂窩等主流旅游平臺(tái)采集全國(guó)5A級(jí)及4A級(jí)景區(qū)的基礎(chǔ)信息包括景點(diǎn)名稱(chēng)、所在城市、經(jīng)緯度坐標(biāo)、景點(diǎn)等級(jí)、門(mén)票價(jià)格、開(kāi)放時(shí)間、景點(diǎn)介紹、主要景點(diǎn)標(biāo)簽等字段。預(yù)期采集景點(diǎn)總數(shù)約1500至2000個(gè)覆蓋全國(guó)31個(gè)省市自治區(qū)。第二用戶(hù)行為與評(píng)分?jǐn)?shù)據(jù)?;诠_(kāi)的旅游推薦數(shù)據(jù)集如TripAdvisor公開(kāi)數(shù)據(jù)集、馬蜂窩用戶(hù)行為數(shù)據(jù)集獲取用戶(hù)對(duì)景點(diǎn)的評(píng)分記錄與評(píng)論內(nèi)容。用戶(hù)數(shù)據(jù)字段包括用戶(hù)ID脫敏處理、景點(diǎn)ID、評(píng)分1—5分、評(píng)論時(shí)間、評(píng)論內(nèi)容、瀏覽時(shí)長(zhǎng)、收藏行為等。預(yù)期獲取用戶(hù)行為記錄總量約50萬(wàn)至80萬(wàn)條覆蓋活躍用戶(hù)約5萬(wàn)至8萬(wàn)人。第三景點(diǎn)評(píng)論與文本數(shù)據(jù)。采集景點(diǎn)下的用戶(hù)評(píng)論文本數(shù)據(jù)用于情感分析與景點(diǎn)標(biāo)簽提取。評(píng)論數(shù)據(jù)字段包括評(píng)論ID、用戶(hù)ID、景點(diǎn)ID、評(píng)論內(nèi)容、評(píng)論時(shí)間、點(diǎn)贊數(shù)等。預(yù)期獲取評(píng)論文本總量約20萬(wàn)至30萬(wàn)條平均評(píng)論長(zhǎng)度約50至100字。2.2 大數(shù)據(jù)分布式數(shù)據(jù)處理流程面對(duì)海量旅游數(shù)據(jù)本研究采用大數(shù)據(jù)分布式計(jì)算框架進(jìn)行數(shù)據(jù)處理具體流程如下第一步數(shù)據(jù)采集與存儲(chǔ)。使用PythonScrapy分布式爬蟲(chóng)框架采集旅游平臺(tái)的景點(diǎn)與評(píng)論數(shù)據(jù)采集到的原始數(shù)據(jù)以JSON格式存入Hadoop分布式文件系統(tǒng)HDFS。HDFS的高容錯(cuò)性與高吞吐量特性能夠可靠存儲(chǔ)TB級(jí)別的旅游數(shù)據(jù)為后續(xù)的分布式計(jì)算提供數(shù)據(jù)底座。第二步數(shù)據(jù)清洗與預(yù)處理?;赟park分布式計(jì)算框架對(duì)HDFS中的原始數(shù)據(jù)進(jìn)行并行化清洗與預(yù)處理包括去除重復(fù)記錄、處理缺失值、過(guò)濾異常數(shù)據(jù)、文本分詞與去停用詞等操作。Spark基于內(nèi)存計(jì)算的特性使得迭代式數(shù)據(jù)處理任務(wù)的執(zhí)行效率相較于傳統(tǒng)MapReduce模型提升10至100倍顯著縮短了大規(guī)模旅游數(shù)據(jù)的預(yù)處理時(shí)間。第三步特征工程與數(shù)據(jù)融合。在SparkMLlib工具包的支持下對(duì)清洗后的數(shù)據(jù)進(jìn)行特征工程處理包括用戶(hù)特征提取評(píng)分均值、評(píng)分?jǐn)?shù)量、活躍時(shí)段等、景點(diǎn)特征提取評(píng)分均值、評(píng)論數(shù)量、景點(diǎn)類(lèi)別標(biāo)簽等、用戶(hù)-景點(diǎn)交互矩陣構(gòu)建。同時(shí)將景點(diǎn)基礎(chǔ)信息、用戶(hù)行為數(shù)據(jù)與評(píng)論文本數(shù)據(jù)進(jìn)行關(guān)聯(lián)融合構(gòu)建統(tǒng)一的旅游推薦數(shù)據(jù)集。第四步推薦模型訓(xùn)練與分布式計(jì)算。基于SparkMLlib中的ALS交替最小二乘法推薦算法庫(kù)對(duì)用戶(hù)-景點(diǎn)評(píng)分矩陣進(jìn)行并行化模型訓(xùn)練。分布式訓(xùn)練模式將大規(guī)模矩陣分解任務(wù)分發(fā)到多個(gè)計(jì)算節(jié)點(diǎn)上并行執(zhí)行相較于單機(jī)訓(xùn)練模式能夠處理更大規(guī)模的數(shù)據(jù)集同時(shí)顯著縮短模型訓(xùn)練時(shí)間。第五步數(shù)據(jù)劃分與模型評(píng)估。按照8:2的比例將數(shù)據(jù)集劃分為訓(xùn)練集與測(cè)試集使用Precision、Recall、F1值、RMSE等評(píng)估指標(biāo)對(duì)推薦模型的性能進(jìn)行量化評(píng)估驗(yàn)證分布式推薦算法在旅游數(shù)據(jù)上的實(shí)際效果。三、國(guó)內(nèi)外研究現(xiàn)狀3.1 國(guó)外研究現(xiàn)狀國(guó)外學(xué)者在旅游推薦系統(tǒng)與大數(shù)據(jù)分布式處理領(lǐng)域的研究起步較早已形成較為成熟的技術(shù)體系。Chouiref等2023提出了一種融合隨機(jī)森林與樸素貝葉斯的混合旅游推薦算法H-RN結(jié)合基于模型與基于記憶的協(xié)同過(guò)濾技術(shù)在四個(gè)真實(shí)旅游數(shù)據(jù)集上進(jìn)行實(shí)驗(yàn)驗(yàn)證。實(shí)驗(yàn)結(jié)果表明H-RN算法在Recall、Precision、Accuracy、F-measure等指標(biāo)上均優(yōu)于基線(xiàn)方法在前人單一協(xié)同過(guò)濾算法的基礎(chǔ)上融合多種機(jī)器學(xué)習(xí)算法實(shí)現(xiàn)了混合推薦范式。Asaithambi等2023提出了一種增強(qiáng)型大數(shù)據(jù)分析旅游推薦模型整合了景點(diǎn)圖片、用戶(hù)評(píng)論、天氣預(yù)報(bào)、社交媒體熱點(diǎn)等多源異構(gòu)數(shù)據(jù)。該系統(tǒng)基于Spark分布式計(jì)算框架實(shí)現(xiàn)集成了樸素貝葉斯分類(lèi)器、深度學(xué)習(xí)卷積神經(jīng)網(wǎng)絡(luò)CNN、時(shí)間序列分析與情感分析等多種機(jī)器學(xué)習(xí)模型。實(shí)驗(yàn)結(jié)果表明多模型融合的混合推薦系統(tǒng)在個(gè)性化旅游推薦任務(wù)上取得了良好效果在前人單一數(shù)據(jù)源推薦的基礎(chǔ)上引入了多模態(tài)大數(shù)據(jù)融合分析。Omar等2023提出了基于云平臺(tái)的大數(shù)據(jù)推薦系統(tǒng)架構(gòu)采用HDFS作為分布式存儲(chǔ)結(jié)合SparkALS算法與深度神經(jīng)網(wǎng)絡(luò)DNN實(shí)現(xiàn)協(xié)同過(guò)濾推薦。實(shí)驗(yàn)在Goodreads網(wǎng)站采集的大規(guī)模數(shù)據(jù)集上進(jìn)行結(jié)果表明SparkALS算法與DNN算法的組合在推薦精度上達(dá)到了73%顯著優(yōu)于傳統(tǒng)單機(jī)方法。該研究驗(yàn)證了HadoopSpark大數(shù)據(jù)棧在大規(guī)模推薦場(chǎng)景下的技術(shù)可行性在前人單機(jī)推薦算法的基礎(chǔ)上引入了分布式計(jì)算架構(gòu)處理海量用戶(hù)數(shù)據(jù)。Lapatta等2022提出了基于ApacheSpark集群的生態(tài)旅游推薦系統(tǒng)采用天際線(xiàn)查詢(xún)算法與SentiStrength情感分析方法。實(shí)驗(yàn)結(jié)果表明Spark三節(jié)點(diǎn)集群在關(guān)聯(lián)數(shù)據(jù)上的執(zhí)行速度比單機(jī)快213.7倍在獨(dú)立數(shù)據(jù)上快240倍在反關(guān)聯(lián)數(shù)據(jù)上快288.1倍同時(shí)情感分析準(zhǔn)確率達(dá)到78.3%。該研究量化驗(yàn)證了Spark分布式計(jì)算在旅游大數(shù)據(jù)處理中的性能優(yōu)勢(shì)在前人單機(jī)數(shù)據(jù)處理的基礎(chǔ)上驗(yàn)證了分布式集群的加速比與可擴(kuò)展性。3.2 國(guó)內(nèi)研究現(xiàn)狀國(guó)內(nèi)學(xué)者在旅游推薦系統(tǒng)與大數(shù)據(jù)分布式處理領(lǐng)域的研究近年來(lái)呈現(xiàn)快速增長(zhǎng)態(tài)勢(shì)技術(shù)路線(xiàn)從傳統(tǒng)的單機(jī)推薦算法逐步向分布式計(jì)算與深度學(xué)習(xí)方向演進(jìn)。孫俊玲等2024通過(guò)爬蟲(chóng)技術(shù)從旅行網(wǎng)站采集景點(diǎn)數(shù)據(jù)在公開(kāi)數(shù)據(jù)集上對(duì)UserCF與ItemCF兩種協(xié)同過(guò)濾算法進(jìn)行了對(duì)比測(cè)試。實(shí)驗(yàn)結(jié)果表明UserCF能夠更準(zhǔn)確地預(yù)測(cè)用戶(hù)喜歡的物品推薦準(zhǔn)確率與召回率更高但覆蓋率略低ItemCF能夠覆蓋更多物品為用戶(hù)提供更多選擇。該研究系統(tǒng)對(duì)比了兩種經(jīng)典協(xié)同過(guò)濾算法在旅游推薦場(chǎng)景下的性能差異在前人單一算法應(yīng)用的基礎(chǔ)上開(kāi)展了UserCF與ItemCF的橫向?qū)Ρ仍u(píng)估。楊佳鵬等2024提出了基于Spark框架的瀑布型融合旅游推薦系統(tǒng)采用SimHash算法實(shí)現(xiàn)海量數(shù)據(jù)的降維處理結(jié)合余弦相似度與TF-IDF算法完成景點(diǎn)推薦計(jì)算并通過(guò)地圖可視化將推薦結(jié)果以經(jīng)緯度坐標(biāo)形式展示。該研究驗(yàn)證了Spark內(nèi)存計(jì)算框架在旅游推薦場(chǎng)景下的實(shí)時(shí)性?xún)?yōu)勢(shì)在前人MapReduce批處理模型的基礎(chǔ)上采用Spark框架實(shí)現(xiàn)了更低延遲的實(shí)時(shí)推薦計(jì)算。宮園園等2021針對(duì)民俗文化旅游資源信息量大、單機(jī)平臺(tái)推薦效果差的問(wèn)題提出了基于Hadoop平臺(tái)的民俗文化旅游資源推薦系統(tǒng)。系統(tǒng)將預(yù)處理后的數(shù)據(jù)導(dǎo)入HDFS分布式文件系統(tǒng)采用MapReduce編程模型并行實(shí)現(xiàn)協(xié)同過(guò)濾推薦算法。仿真實(shí)驗(yàn)結(jié)果表明基于Hadoop的推薦系統(tǒng)在推薦精度與推薦效率上均優(yōu)于單機(jī)版本在前人單機(jī)推薦系統(tǒng)的基礎(chǔ)上引入Hadoop分布式架構(gòu)實(shí)現(xiàn)了大規(guī)模旅游資源的并行化推薦。馮藝佳等2023提出了融合MapReduce與Hive的分布式ItemCF推薦算法HiMRItemCF將ItemCF算法拆分為六個(gè)步驟分別使用Hive與MapReduce實(shí)現(xiàn)不同步驟的并行化計(jì)算。在三個(gè)公開(kāi)用戶(hù)購(gòu)物行為數(shù)據(jù)集上的實(shí)驗(yàn)結(jié)果表明該算法相較于僅使用MapReduce的方案具有更簡(jiǎn)潔的代碼結(jié)構(gòu)與更高的并行計(jì)算效率在前人單一MapReduce并行化方案的基礎(chǔ)上融合Hive與MapReduce的優(yōu)勢(shì)實(shí)現(xiàn)了更高效的分布式ItemCF推薦。3.3 研究述評(píng)綜合國(guó)內(nèi)外研究現(xiàn)狀可以發(fā)現(xiàn)當(dāng)前旅游推薦系統(tǒng)領(lǐng)域已在以下方面取得顯著進(jìn)展一是推薦算法從單一協(xié)同過(guò)濾演進(jìn)到融合內(nèi)容推薦、機(jī)器學(xué)習(xí)、深度學(xué)習(xí)的混合推薦范式二是數(shù)據(jù)規(guī)模從數(shù)千條的小規(guī)模數(shù)據(jù)集發(fā)展到百萬(wàn)級(jí)用戶(hù)行為數(shù)據(jù)三是計(jì)算架構(gòu)從單機(jī)模式逐步演進(jìn)到HadoopSpark分布式集群模式四是數(shù)據(jù)維度從單純的用戶(hù)評(píng)分?jǐn)U展到評(píng)論文本、地理位置、天氣事件等多源異構(gòu)數(shù)據(jù)。然而現(xiàn)有研究仍存在以下可拓展的空間其一多數(shù)研究聚焦于算法層面的實(shí)驗(yàn)驗(yàn)證缺乏完整的前后端系統(tǒng)設(shè)計(jì)與工程實(shí)現(xiàn)其二現(xiàn)有旅游推薦系統(tǒng)多為純算法原型缺少面向用戶(hù)的完整Web應(yīng)用與交互式可視化界面其三將大語(yǔ)言模型引入旅游推薦的解釋性生成與用戶(hù)畫(huà)像深度理解的研究尚不多見(jiàn)。本研究在前人基礎(chǔ)上提出新想法擬基于SpringBootVue構(gòu)建完整的旅游信息推薦Web系統(tǒng)融合HadoopSpark大數(shù)據(jù)分布式處理架構(gòu)同時(shí)引入DeepSeekAI大模型實(shí)現(xiàn)推薦理由的自然語(yǔ)言生成與用戶(hù)偏好的深度解讀彌補(bǔ)現(xiàn)有研究在工程完整性與智能化程度上的不足。四、系統(tǒng)功能設(shè)計(jì)4.1 系統(tǒng)總體架構(gòu)本系統(tǒng)采用前后端分離的分層架構(gòu)設(shè)計(jì)自下而上分為大數(shù)據(jù)層、算法層、服務(wù)層、應(yīng)用層四個(gè)層級(jí)。各層之間通過(guò)標(biāo)準(zhǔn)接口解耦確保系統(tǒng)的可擴(kuò)展性與可維護(hù)性。大數(shù)據(jù)層負(fù)責(zé)海量旅游數(shù)據(jù)的分布式存儲(chǔ)與并行處理采用HadoopHDFS作為分布式文件存儲(chǔ)系統(tǒng)Spark計(jì)算引擎實(shí)現(xiàn)推薦算法的并行化訓(xùn)練與計(jì)算。 算法層負(fù)責(zé)推薦算法的實(shí)現(xiàn)與模型訓(xùn)練包括基于SparkMLlib的ALS協(xié)同過(guò)濾推薦、基于Python的景點(diǎn)標(biāo)簽提取、混合推薦融合等核心算法模塊。服務(wù)層基于SpringBoot框架構(gòu)建后端服務(wù)提供用戶(hù)管理、景點(diǎn)管理、推薦服務(wù)、評(píng)論管理、個(gè)人畫(huà)像等RESTful API接口。應(yīng)用層基于Vue.js框架構(gòu)建前端交互界面包括推薦首頁(yè)、景點(diǎn)詳情、個(gè)人中心、評(píng)論反饋、數(shù)據(jù)可視化大屏等頁(yè)面。4.2 核心功能模塊模塊一用戶(hù)管理與畫(huà)像模塊。支持用戶(hù)注冊(cè)登錄、個(gè)人信息管理、出行偏好設(shè)置、瀏覽歷史查詢(xún)等功能。用戶(hù)首次使用時(shí)通過(guò)選擇偏好標(biāo)簽如自然景觀(guān)、歷史人文、主題樂(lè)園、美食購(gòu)物等完成初始畫(huà)像構(gòu)建。模塊二景點(diǎn)瀏覽與搜索模塊。提供景點(diǎn)列表展示、景點(diǎn)詳情查看、景點(diǎn)分類(lèi)篩選、景點(diǎn)搜索等功能。展示景點(diǎn)圖片、門(mén)票價(jià)格、開(kāi)放時(shí)間、景點(diǎn)標(biāo)簽、用戶(hù)評(píng)分、評(píng)論列表等詳細(xì)信息。模塊三個(gè)性化推薦模塊。系統(tǒng)的核心模塊基于Spark分布式計(jì)算框架訓(xùn)練ALS協(xié)同過(guò)濾推薦模型為每位用戶(hù)生成個(gè)性化的Top-N旅游景點(diǎn)推薦列表。推薦結(jié)果按場(chǎng)景分為為你推薦“喜歡旅行的人也看過(guò)”“同類(lèi)景點(diǎn)推薦”周邊熱門(mén)景點(diǎn)等多個(gè)推薦頻道。模塊四評(píng)價(jià)與反饋模塊。支持用戶(hù)對(duì)景點(diǎn)進(jìn)行評(píng)分1—5星與文字評(píng)論系統(tǒng)基于用戶(hù)評(píng)論數(shù)據(jù)持續(xù)優(yōu)化推薦模型。同時(shí)支持用戶(hù)收藏景點(diǎn)、分享景點(diǎn)等交互行為。模塊五DeepSeekAI智能推薦解釋模塊。調(diào)用DeepSeekAI大模型API根據(jù)用戶(hù)的歷史瀏覽記錄與偏好標(biāo)簽自動(dòng)生成個(gè)性化的推薦理由與旅行建議。該模塊的執(zhí)行邏輯遵循執(zhí)行過(guò)程結(jié)果三段式結(jié)構(gòu)執(zhí)行環(huán)節(jié)將用戶(hù)畫(huà)像特征與推薦景點(diǎn)列表批量傳入DeepSeekAI接口設(shè)定為每位用戶(hù)生成5條個(gè)性化推薦理由的任務(wù)指令過(guò)程環(huán)節(jié)通過(guò)API調(diào)用獲取模型返回的結(jié)構(gòu)化分析結(jié)果包括用戶(hù)偏好分析、景點(diǎn)特色解讀、出行建議生成結(jié)果環(huán)節(jié)將大模型生成的自然語(yǔ)言推薦理由與推薦景點(diǎn)列表進(jìn)行融合展示提升推薦結(jié)果的可解釋性與用戶(hù)體驗(yàn)。模塊六數(shù)據(jù)可視化大屏模塊。面向旅游運(yùn)營(yíng)方的數(shù)據(jù)分析可視化界面展示全國(guó)景點(diǎn)熱度排行、用戶(hù)偏好分布、季節(jié)出行趨勢(shì)、地域分布熱力圖等統(tǒng)計(jì)圖表為旅游產(chǎn)品運(yùn)營(yíng)決策提供數(shù)據(jù)支撐。五、技術(shù)路線(xiàn)與技術(shù)棧5.1 技術(shù)路線(xiàn)本研究的技術(shù)路線(xiàn)遵循數(shù)據(jù)采集—分布式存儲(chǔ)—分布式處理—算法訓(xùn)練—系統(tǒng)開(kāi)發(fā)—測(cè)試優(yōu)化的完整大數(shù)據(jù)處理流程。第一階段為數(shù)據(jù)采集與分布式存儲(chǔ)。通過(guò)Python爬蟲(chóng)技術(shù)從旅游平臺(tái)采集景點(diǎn)與評(píng)論數(shù)據(jù)將原始數(shù)據(jù)存入HadoopHDFS分布式文件系統(tǒng)利用HDFS的高容錯(cuò)性實(shí)現(xiàn)海量旅游數(shù)據(jù)的可靠存儲(chǔ)。第二階段為分布式數(shù)據(jù)預(yù)處理。基于Spark計(jì)算引擎對(duì)HDFS中的原始數(shù)據(jù)進(jìn)行并行化清洗與預(yù)處理包括數(shù)據(jù)去重、缺失值處理、文本分詞、特征提取等操作。Spark的內(nèi)存計(jì)算特性顯著提升了大規(guī)模數(shù)據(jù)預(yù)處理的效率。第三階段為推薦算法設(shè)計(jì)與分布式訓(xùn)練。首先實(shí)現(xiàn)基于用戶(hù)的協(xié)同過(guò)濾算法作為基線(xiàn)模型然后基于SparkMLlib中的ALS算法庫(kù)進(jìn)行分布式模型訓(xùn)練對(duì)比單機(jī)與分布式模式的性能差異。最后設(shè)計(jì)融合協(xié)同過(guò)濾與內(nèi)容推薦的混合推薦算法在測(cè)試集上驗(yàn)證推薦效果。第四階段為系統(tǒng)后端開(kāi)發(fā)?;赟pringBoot框架搭建后端服務(wù)實(shí)現(xiàn)用戶(hù)管理、景點(diǎn)管理、推薦服務(wù)、評(píng)價(jià)管理等核心業(yè)務(wù)接口集成推薦算法引擎完成與前端的數(shù)據(jù)交互。第五階段為系統(tǒng)前端開(kāi)發(fā)?;赩ue.js框架構(gòu)建用戶(hù)端Web界面實(shí)現(xiàn)推薦首頁(yè)、景點(diǎn)詳情、個(gè)人中心、評(píng)價(jià)反饋等頁(yè)面對(duì)接后端API完成數(shù)據(jù)展示與交互功能。第六階段為系統(tǒng)測(cè)試與優(yōu)化。開(kāi)展功能測(cè)試、性能測(cè)試與推薦效果評(píng)估根據(jù)測(cè)試結(jié)果優(yōu)化推薦算法與系統(tǒng)性能完成最終版本的系統(tǒng)交付。5.2 核心技術(shù)棧大數(shù)據(jù)存儲(chǔ)Hadoop 3.x——HDFS分布式文件系統(tǒng)存儲(chǔ)原始旅游數(shù)據(jù)與中間計(jì)算結(jié)果YARN資源調(diào)度管理器統(tǒng)一管理集群計(jì)算資源Hive數(shù)據(jù)倉(cāng)庫(kù)實(shí)現(xiàn)結(jié)構(gòu)化旅游數(shù)據(jù)的SQL查詢(xún)與統(tǒng)計(jì)分析。分布式計(jì)算Spark 3.x ——Spark Core核心計(jì)算引擎實(shí)現(xiàn)分布式數(shù)據(jù)處理與內(nèi)存計(jì)算SparkSQL基于Hive元數(shù)據(jù)進(jìn)行SQL式分析MLlib機(jī)器學(xué)習(xí)庫(kù)提供ALS協(xié)同過(guò)濾、分類(lèi)、聚類(lèi)等算法的分布式實(shí)現(xiàn)SparkStreaming實(shí)現(xiàn)實(shí)時(shí)數(shù)據(jù)的流式處理。 后端技術(shù)SpringBoot2.7框架作為后端核心提供依賴(lài)注入、自動(dòng)配置、RESTful接口等基礎(chǔ)能力MyBatis-Plus作為ORM框架實(shí)現(xiàn)數(shù)據(jù)庫(kù)操作SpringSecurity實(shí)現(xiàn)用戶(hù)認(rèn)證與權(quán)限控制。 前端技術(shù)Vue 3框架作為前端核心配合VueRouter實(shí)現(xiàn)路由管理Pinia實(shí)現(xiàn)狀態(tài)管理Axios實(shí)現(xiàn)HTTP請(qǐng)求對(duì)接后端APIElement Plus組件庫(kù)提供UI組件支持。數(shù)據(jù)處理與算法Python3.9作為數(shù)據(jù)處理與算法開(kāi)發(fā)語(yǔ)言Scrapy爬蟲(chóng)框架負(fù)責(zé)旅游數(shù)據(jù)采集scikit-learn與Gensim用于推薦算法原型驗(yàn)證PySpark實(shí)現(xiàn)Spark分布式計(jì)算的Python開(kāi)發(fā)。大語(yǔ)言模型DeepSeekAI大模型API用于推薦理由生成與用戶(hù)畫(huà)像深度分析實(shí)現(xiàn)推薦結(jié)果的可解釋性與個(gè)性化解讀。數(shù)據(jù)庫(kù)與緩存MySQL 8.0存儲(chǔ)用戶(hù)、景點(diǎn)、訂單、評(píng)價(jià)等核心業(yè)務(wù)數(shù)據(jù)Redis6.0緩存熱點(diǎn)推薦結(jié)果與用戶(hù)會(huì)話(huà)信息提升系統(tǒng)響應(yīng)速度。六、可視化方案設(shè)計(jì)本研究的可視化方案圍繞數(shù)據(jù)驅(qū)動(dòng)、直觀(guān)易懂的設(shè)計(jì)原則設(shè)計(jì)以下核心可視化圖表熱門(mén)旅游城市搜索量柱狀圖采用橫向柱狀圖展示2023年至2026年間全國(guó)TOP10熱門(mén)旅游城市的年度景點(diǎn)搜索量對(duì)比。柱狀圖的縱軸為城市名稱(chēng)橫軸為年度搜索量萬(wàn)次每個(gè)城市對(duì)應(yīng)四根柱子分別代表2023年、2024年、2025年、2026年四個(gè)年度的數(shù)據(jù)。通過(guò)柱狀圖的長(zhǎng)度對(duì)比可直觀(guān)呈現(xiàn)各旅游城市的熱度年度變化趨勢(shì)。預(yù)期數(shù)據(jù)顯示2023年TOP1城市搜索量約為1200萬(wàn)次2024年增長(zhǎng)至1800萬(wàn)次2025年達(dá)到2300萬(wàn)次2026年上半年已突破1400萬(wàn)次整體呈現(xiàn)逐年增長(zhǎng)態(tài)勢(shì)。用戶(hù)群體旅游偏好雷達(dá)圖采用五維雷達(dá)圖展示不同用戶(hù)群體的旅游偏好維度對(duì)比五個(gè)維度分別為自然景觀(guān)偏好、人文歷史偏好、主題樂(lè)園偏好、美食購(gòu)物偏好、休閑度假偏好。雷達(dá)圖的每個(gè)頂點(diǎn)對(duì)應(yīng)一個(gè)偏好維度不同用戶(hù)群體青年學(xué)生、白領(lǐng)上班族、退休中老年、家庭親子以不同顏色的多邊形疊加展示。通過(guò)雷達(dá)圖的形狀對(duì)比可直觀(guān)識(shí)別各類(lèi)用戶(hù)群體的旅游偏好差異。例如青年學(xué)生在主題樂(lè)園偏好維度得分最高平均4.3分但在人文歷史偏好維度得分偏低平均2.9分退休中老年在人文歷史偏好維度得分突出平均4.5分但在主題樂(lè)園偏好維度相對(duì)較低平均2.6分。景點(diǎn)搜索量季節(jié)趨勢(shì)折線(xiàn)圖采用時(shí)間序列折線(xiàn)圖展示旅游景點(diǎn)月度搜索量的變化趨勢(shì)。折線(xiàn)圖的橫軸為時(shí)間2023年1月至2026年6月共42個(gè)月縱軸為月度搜索量萬(wàn)次。圖中繪制多條折線(xiàn)分別代表不同類(lèi)型景點(diǎn)的搜索量變化曲線(xiàn)并標(biāo)注春節(jié)、五一、國(guó)慶等節(jié)假日對(duì)應(yīng)的時(shí)間節(jié)點(diǎn)。通過(guò)折線(xiàn)圖的起伏變化可觀(guān)察旅游搜索的季節(jié)性波動(dòng)規(guī)律識(shí)別旅游旺季的時(shí)間節(jié)點(diǎn)與峰值。景點(diǎn)類(lèi)型分布餅圖采用餅圖展示全國(guó)旅游景點(diǎn)的類(lèi)型分布比例?;诰包c(diǎn)標(biāo)簽數(shù)據(jù)統(tǒng)計(jì)自然景觀(guān)、人文歷史、主題樂(lè)園、宗教文化、鄉(xiāng)村旅游等類(lèi)型的占比。例如自然景觀(guān)類(lèi)景點(diǎn)占比最高約35%其次是人文歷史類(lèi)約25%主題樂(lè)園類(lèi)占比約15%宗教文化類(lèi)占比約12%鄉(xiāng)村旅游類(lèi)占比約8%其他類(lèi)型占比約5%。通過(guò)餅圖的扇區(qū)占比可直觀(guān)了解全國(guó)旅游景點(diǎn)的整體類(lèi)型分布特征。推薦算法性能對(duì)比環(huán)形圖采用環(huán)形圖展示推薦算法的性能對(duì)比結(jié)果。對(duì)比單機(jī)協(xié)同過(guò)濾、Spark分布式ALS、混合推薦三種算法在Precision、Recall、F1值、NDCG四項(xiàng)指標(biāo)上的表現(xiàn)。例如Spark分布式ALS算法的Precision為0.82Recall為0.76F1值為0.79NDCG為0.85相較于單機(jī)協(xié)同過(guò)濾算法各項(xiàng)指標(biāo)均有提升混合推薦算法進(jìn)一步優(yōu)化至Precision0.86、Recall 0.80、F1值0.83、NDCG 0.88。通過(guò)環(huán)形圖的多維度對(duì)比可直觀(guān)展示分布式推薦算法與混合推薦的性能優(yōu)勢(shì)。