So sánh mô hình kinh tế lượng Arima và học máy Random Forest trong dự báo chi phí vận hành ngành logistics Việt Nam
Nguyễn Thị Thu Hà
Khoa Quản lý Công nghiệp và Năng lượng, Trường Đại học Điện lực
Email: [email protected]
Đỗ Hữu Chế
Trung tâm Truyền thông, Quan hệ doanh nghiệp và Đào tạo về sử dụng năng lượng tiết kiệm, hiệu quả,
Trường Đại học Điện lực
Tóm tắt
Trong những năm qua, ngành logistics Việt Nam đạt tốc độ tăng trưởng nhanh nhưng cũng phải chịu áp lực lớn từ chi phí vận hành và biến động thị trường. Nghiên cứu này nhằm so sánh khả năng dự báo Chỉ số Chi phí logistics giữa 2 mô hình: ARIMA truyền thống và Random Forest (RF) học máy với các biến GDP, CPI, Giá dầu diesel và Sản lượng hàng qua cảng. Kết quả kiểm định giai đoạn 2023Q3-2025Q2 cho thấy, RF dự báo chính xác hơn ARIMA(2,1,2). Việc phân tích tầm quan trọng biến cho thấy Giá dầu diesel và Sản lượng hàng qua cảng là các nhân tố chi phối chính biến động của Chỉ số Chi phí logistics. Trên cơ sở đó, nghiên cứu đề xuất chính sách bình ổn giá nhiên liệu, phát triển hạ tầng logistics và mở rộng mô hình dự báo bằng học sâu và dữ liệu tần suất cao để nâng cao hiệu quả quản lý chi phí.
Từ khóa: Logistics Việt Nam, chi phí vận hành, ARIMA, Random Forest, dự báo chuỗi thời gian
Summary
In recent years, Viet Nam’s logistics sector has experienced rapid growth but has also faced significant pressure from operating costs and market volatility. This study compares the forecasting performance of the Logistics Cost Index using two models: the traditional ARIMA approach and the machine-learning-based Random Forest (RF) model, incorporating GDP, CPI, diesel fuel prices, and port cargo throughput as explanatory variables. Empirical testing over the period 2023Q3-2025Q2 indicates that the RF model provides more accurate forecasts than the ARIMA(2,1,2) model. Variable importance analysis indicates that diesel fuel prices and port cargo throughput are the dominant drivers of fluctuations in the Logistics Cost Index. Based on these findings, the study proposes policy implications, including fuel price stabilization, logistics infrastructure development, and extending forecasting models using deep learning and high-frequency data to enhance cost management effectiveness.
Keywords: Viet Nam logistics, operating costs, ARIMA, Random Forest, time-series forecasting
GIỚI THIỆU
Theo báo cáo của Bộ Công Thương (2023), chi phí logistics của Việt Nam duy trì ở mức 16-17% GDP, cao hơn mức trung bình thế giới (10-12%), qua đó làm suy giảm năng lực cạnh tranh của doanh nghiệp và nền kinh tế. Giai đoạn 2023-2025 ghi nhận nhiều biến động bất lợi như giá nhiên liệu, tắc nghẽn tại các cảng cửa ngõ và áp lực tuân thủ môi trường, khiến chi phí vận hành khó dự báo và kiểm soát. Trong khi mô hình ARIMA - phương pháp dự báo chuỗi thời gian truyền thống (dựa trên các thành phần: tự hồi quy, sai phân để làm chuỗi dững và trung bình trượt) là chuẩn mực để mô hình hóa chuỗi thời gian tuyến tính, dữ liệu logistics Việt Nam cho thấy đặc điểm phi tuyến và tác động đa biến rõ rệt. Điều này gợi ý tiềm năng vượt trội của Random Forest - RF (mô hình học máy) trong thực tiễn dự báo. Nghiên cứu này nhằm so sánh định lượng năng lực dự báo Chỉ số Chi phí logistics giữa ARIMA và Random Forest (RF), đồng thời nhận diện các nhân tố chi phối biến động chi phí, qua đó rút ra hàm ý chính sách - quản trị phù hợp bối cảnh Việt Nam.
CƠ SỞ LÝ THUYẾT
Trong lĩnh vực dự báo chuỗi thời gian kinh tế, mô hình ARIMA (Autoregressive Integrated Moving Average) được xem là một trong những phương pháp kinh điển và được ứng dụng rộng rãi. Theo Box và cộng sự (2016), ARIMA(p,d,q) kết hợp các thành phần tự hồi quy, sai phân và trung bình trượt, phù hợp với chuỗi dừng và mối quan hệ tuyến tính. Ưu điểm của ARIMA là tính minh bạch, khả năng kiểm định thống kê rõ ràng (ADF, Ljung-Box, AIC/BIC). Tuy nhiên mô hình này gặp hạn chế khi dữ liệu chịu tác động của cú sốc ngoại sinh, biến động cấu trúc và các quan hệ phi tuyến.
Random Forest (RF) do Breiman (2001) đề xuất, là mô hình học máy dạng ensemble dựa trên nhiều cây quyết định, cho phép nắm bắt các tương tác phức tạp và phi tuyến mà không yêu cầu giả định phân phối nghiêm ngặt. Random Forest có khả năng xử lý dữ liệu đa biến, giảm hiện tượng quá khớp và cung cấp thước đo tầm quan trọng của biến, hỗ trợ diễn giải kết quả (Molnar, 2022).
Các nghiên cứu quốc tế cho thấy Random Forest thường cho kết quả dự báo vượt trội so với ARIMA trong bối cảnh dữ liệu logistics nhiều nhiễu và chịu tác động đồng thời của các yếu tố vĩ mô và hạ tầng (Zang và cộng sự, 2020). Tuy nhiên, bằng chứng thực nghiệm tại Việt Nam còn hạn chế và chưa khai thác đầy đủ các biến đặc thù như giá dầu diesel và sản lượng hàng hóa qua cảng (Nguyễn và cộng sự, 2023; Phạm, 2021).
PHƯƠNG PHÁP NGHIÊN CỨU
Dữ liệu
Nghiên cứu sử dụng bộ dữ liệu theo quý giai đoạn 2011Q1-2025Q2, trong đó Chỉ số Chi phí logistics (LCI) là biến phụ thuộc; các biến giải thích gồm: GDP thực, CPI, Giá dầu diesel trung bình quý (FUEL) và Sản lượng hàng hóa thông qua cảng (PORT). Dữ liệu được thu thập từ Cục Thống kê, Bộ Công Thương, Cục Hàng hải Việt Nam và Hiệp hội Doanh nghiệp Dịch vụ Logistics Việt Nam (VLA), đồng thời được quy đổi về giá cố định năm 2015 nhằm loại bỏ ảnh hưởng lạm phát. Ngoài ra, khảo sát sơ bộ 15 doanh nghiệp logistics tại TP. Hồ Chí Minh và Hải Phòng được sử dụng để bổ trợ kiểm chứng chuyên gia.
Quy trình ARIMA
Quy trình ước lượng ARIMA gồm: (i) Kiểm định tính dừng (ADF) và sai phân khi cần thiết; (ii) Xác định bậc p, q dựa trên ACF/PACF; (iii) Uớc lượng tham số bằng MLE; (iv) Kiểm định phần dư bằng Ljung-Box; (v) Lựa chọn mô hình tối ưu theo AIC/BIC; và (vi) Thực hiện dự báo ngoài mẫu (Box và cộng sự, 2016).
Quy trình Random Forest (RF)
Đối với Random Forest, nghiên cứu xây dựng các biến trễ của LCI (t-1, t-2), huấn luyện mô hình với lưới tham số gồm số cây (n_estimators = 100-500) và độ sâu tối đa (max_depth = 4-12). Cấu hình tối ưu được lựa chọn thông qua GridSearchCV dựa trên tiêu chí MAPE, sau đó đánh giá hiệu quả dự báo bằng RMSE, MAPE và R². Tầm quan trọng của biến được phân tích bằng phương pháp kỹ thuật đo lường tầm quan trọng của các đặc trưng trong mô hình học máy (permutation importance) (Breiman, 2001; Molnar, 2022).
Chiến lược đánh giá
Dữ liệu được chia thành tập huấn luyện - thẩm định (2011Q1-2023Q2) và tập kiểm định ngoài mẫu (2023Q3-2025Q2). Hiệu quả dự báo giữa 2 mô hình được so sánh bằng kiểm định Diebold-Mariano (DM) với hàm loss là sai số tuyệt đối, ở mức ý nghĩa 5% (Dibold và cộng sự, 1995).
Ghi chú tái lập: Toàn bộ phân tích được thực hiện trên Python 3.11, sử dụng các thư viện statsmodels và scikit-learn; quy trình tiền xử lý, mã hóa biến và seed ngẫu nhiên được kiểm soát nhằm đảm bảo khả năng tái lập kết quả.
KẾT QUẢ NGHIÊN CỨU
Mô hình lựa chọn
Kết quả lựa chọn mô hình cho thấy ARIMA(2,1,2) là cấu hình tối ưu theo các tiêu chí AIC và BIC. Kiểm định Ljung-Box đối với phần dư cho giá trị p = 0,21 cho thấy không tồn tại tự tương quan còn sót lại, qua đó xác nhận mức độ phù hợp của mô hình ARIMA đã lựa chọn. Đối với RF, cấu hình tối ưu được xác định với số cây n_estimators = 300 và độ sâu tối đa max_depth = 8.
Hiệu suất ngoài mẫu
Bảng 1: So sánh hiệu suất dự báo
|
Mô hình |
RMSE |
MAPE |
R² |
|
ARIMA(2,1,2) |
2,84 |
2,15% |
0,842 |
|
Random Forest - RF |
1,96 |
1,42% |
0,923 |
Nguồn: Kết quả nghiên cứu của nhóm tác giả
Hiệu suất dự báo ngoài mẫu trong giai đoạn 2023Q3-2025Q2 được trình bày tại Bảng 1.
Kiểm định Diebold-Mariano (DM) đối với sai số tuyệt đối giữa 2 mô hình RF và ARIMA cho giá trị p = 0,031, cho thấy sự khác biệt về độ chính xác dự báo có ý nghĩa thống kê. Qua đó khẳng định RF có hiệu suất dự báo vượt trội so với ARIMA trong giai đoạn kiểm định.
Nhân tố chi phối chi phí logistics (RF - permutation importance)
Bảng 2: Tầm quan trọng biến
|
Biến |
Đóng góp (%) |
|
FUEL |
38,2 |
|
PORT |
26,5 |
|
GDP |
18,7 |
|
CPI |
10,9 |
|
LCI trễ (t-1, t-2) |
5,7 |
Nguồn: Kết quả nghiên cứu của nhóm tác giả
Kết quả phân tích (Bảng 2) cho thấy Giá nhiên liệu và Sản lượng hàng hóa thông qua cảng là 2 trụ cột quyết định biến động của LCI. Phát hiện này phù hợp với phản ánh của doanh nghiệp về mức độ nhạy cảm cao của chi phí vận tải trước biến động giá dầu diesel cũng như thời gian lưu bãi phát sinh do tình trạng tắc nghẽn cảng. Trong khi đó, GDP và CPI tác động đến Chi phí logistics thông qua kênh cầu và chi phí đầu vào của nền kinh tế. Ngược lại, động lực nội tại của chuỗi thời gian, thể hiện qua các biến trễ của LCI chỉ đóng vai trò bổ trợ và có mức ảnh hưởng tương đối hạn chế.
Thảo luận
ARIMA phù hợp trong các trường hợp cần làm rõ mối quan hệ tuyến tính và kiểm định giả thuyết, đặc biệt hữu ích đối với các báo cáo chính sách đòi hỏi tính minh bạch về cơ chế tác động. Tuy nhiên, trong bối cảnh dữ liệu logistics với cấu trúc nhiễu, tồn tại quan hệ phi tuyến và thường xuyên chịu cú sốc ngoại sinh (như biến động giá dầu, đứt gãy chuỗi cung ứng), Random Forest (RF) cho sai số dự báo thấp hơn đáng kể và thể hiện khả năng thích ứng tốt hơn trước sự thay đổi của các biến ngoại sinh. Mặc dù rủi ro quá khớp đã được kiểm soát thông qua đánh giá ngoài mẫu và kiểm định Diebold-Mariano, quy mô mẫu theo quý còn hạn chế (58 quan sát) vẫn là yếu tố cần được cân nhắc thận trọng khi triển khai mô hình trong thực tiễn.
KẾT LUẬN VÀ HÀM Ý CHÍNH SÁCH
Kết luận
Dựa trên bộ dữ liệu nội sinh giai đoạn 2011-2025 và khung đánh giá ngoài mẫu nghiêm ngặt, nghiên cứu này cung cấp bằng chứng thực nghiệm quan trọng về sự khác biệt hiệu suất giữa mô hình kinh tế lượng truyền thống và mô hình học máy trong dự báo chi phí vận hành logistics tại Việt Nam. Kết quả cho thấy mô hình Random Forest vượt trội so với ARIMA(2,1,2) trên cả 3 thước đo chính gồm RMSE, MAPE và R², đồng thời sự cải thiện có ý nghĩa thống kê theo kiểm định Diebold-Mariano. Điều này khẳng định rằng trong bối cảnh dữ liệu logistics Việt Nam có đặc trưng phi tuyến, nhiễu cao và chịu tác động mạnh từ các cú sốc ngoại sinh (giá nhiên liệu, tắc nghẽn cảng, biến động nhu cầu), các mô hình học máy có khả năng thích ứng, xử lý tương tác biến và khai thác cấu trúc ẩn trong dữ liệu tốt hơn các mô hình tuyến tính truyền thống.
Ngoài ra, phân tích tầm quan trọng biến cho thấy 2 yếu tố FUEL và PORT là các nhân tố quyết định đối với biến thiên LCI, phản ánh đúng thực trạng vận hành logistics: giá nhiên liệu chi phối trực tiếp chi phí vận tải, trong khi năng lực thông qua cảng và mức độ tắc nghẽn ảnh hưởng mạnh đến chi phí thời gian và chi phí cơ hội của doanh nghiệp. Điều này không chỉ củng cố tính tin cậy của mô hình Random Forest mà còn cung cấp góc nhìn định lượng giúp các nhà hoạch định chính sách tập trung chính xác vào các điểm nghẽn then chốt trong chuỗi cung ứng quốc gia.
Hàm ý chính sách
Một là, ổn định chi phí nhiên liệu. Biến động giá dầu là nguồn cú sốc ngoại sinh lớn nhất đối với Chỉ số Chi phí logistics, do đó cần thiết lập một cơ chế đệm giá có điều kiện cho các phân khúc vận tải cốt lõi, đặc biệt là vận tải đường bộ và đường thủy nội địa. Cơ chế này nên được kích hoạt khi giá dầu vượt ngưỡng do Nhà nước công bố và tự động vô hiệu khi giá quay trở lại vùng cân bằng, nhằm hạn chế can thiệp kéo dài và tránh làm méo mó tín hiệu thị trường trong dài hạn.
Việc áp dụng đệm giá cần gắn chặt với các điều kiện về công nghệ và môi trường. Cụ thể, doanh nghiệp được hưởng hỗ trợ phải có lộ trình thay thế hoặc hoán cải phương tiện đạt tiêu chuẩn khí thải Euro V hoặc tương đương, lắp đặt thiết bị giám sát tiêu hao nhiên liệu và tham gia các chương trình lái xe tiết kiệm nhiên liệu (eco-driving). Song song với đó, Nhà nước cần triển khai các gói tín dụng ưu đãi và cơ chế khấu hao nhanh đối với phương tiện sử dụng LNG, điện hoặc hybrid, ưu tiên các đội xe hoạt động trên tuyến cảng - hậu phương với tần suất quay vòng cao nhằm tối đa hóa hiệu quả giảm chi phí và phát thải.
Hai là, nâng cấp kết nối cảng - hậu phương. Tắc nghẽn tại các cụm cảng cửa ngõ như Cái Mép - Thị Vải và Lạch Huyện (Hải Phòng) đang tạo ra chi phí ẩn đáng kể, đặc biệt là thời gian chờ cổng và chi phí lưu bãi. Do đó, cần ưu tiên phát triển kết nối đường sắt - cảng thông qua các cảng cạn (ICD)/hậu phương nhằm chuyển dịch một phần lưu lượng container khỏi đường bộ, qua đó giảm áp lực tắc nghẽn mạng lưới.
Ở cấp độ vận hành, cần đẩy mạnh số hóa quy trình cảng, bao gồm slot-booking tại cổng, đặt lịch xếp dỡ theo khung giờ, nhận dạng tự động và chứng từ điện tử để rút ngắn thời gian xử lý. Đồng thời, thí điểm điều phối vận tải đa phương thức (rail-road-barge) gắn với lịch tàu thực tế, kết hợp chuẩn hóa và minh bạch hóa các khoản phụ phí logistics nhằm nâng cao khả năng dự báo và kiểm soát chi phí.
Ba là, xây dựng nền tảng dữ liệu logistics quốc gia. Để giảm bất định và nâng cao độ chính xác dự báo, cần hình thành một Data Hub quốc gia tích hợp dữ liệu thời gian thực về giá nhiên liệu, lưu lượng và tắc nghẽn đường - cảng, lịch tàu (AIS), công suất xếp dỡ, giá cước và thông quan hải quan. Nền tảng này cần kết nối Hải quan - cảng - doanh nghiệp thông qua chuẩn API thống nhất, vận hành theo mô hình data trust (cơ quan chủ trì - hiệp hội doanh nghiệp đồng quản) với sự đồng quản giữa cơ quan nhà nước và hiệp hội doanh nghiệp nhằm cân bằng chia sẻ dữ liệu và bảo mật.
Việc triển khai dữ liệu mở có kiểm soát (open API theo tầng quyền) sẽ khuyến khích phát triển các mô hình dự báo, ứng dụng tối ưu tuyến và bảng điều khiển (dashboard) rủi ro chuỗi cung ứng. Đồng thời, cần ban hành bộ tiêu chuẩn dữ liệu thống nhất (định danh tuyến, cảng, phương tiện; đơn vị đo; độ trễ cập nhật) và cơ chế kiểm định chất lượng định kỳ để đảm bảo tính tin cậy và khả năng khai thác dữ liệu.
Bốn là, thể chế hóa dự báo trong điều hành. Cần thiết lập quy trình dự báo - ra quyết định chuẩn hóa ở cấp bộ, ngành và địa phương, trong đó Random Forest được sử dụng cho dự báo ngắn hạn theo quý, còn các mô hình học sâu như LSTM hoặc TCN phục vụ dự báo trung hạn. Kết quả dự báo nên được trình bày dưới 3 kịch bản (cơ sở, bất lợi và thuận lợi) gắn với các biến số chính sách (như thuế nhiên liệu, phí hạ tầng cảng và chuẩn khí thải). Các kịch bản này cần được tích hợp vào dashboard điều hành, kèm theo các ngưỡng kích hoạt công cụ chính sách cụ thể. Đồng thời, áp dụng cơ chế đánh giá hậu kiểm định kỳ theo quý (ex-post review) nhằm so sánh kết quả dự báo với thực tế, từ đó hiệu chỉnh mô hình và công bố minh bạch kết quả để nâng cao trách nhiệm giải trình và hiệu quả điều hành.
Tài liệu tham khảo:
1. Bộ Công Thương (2023). Báo cáo thường niên ngành Logistics Việt Nam 2023. Nxb Công Thương.
2. Box, G. E. P., Jenkins, G. M., & Reinsel, G. C (2016). Time Series Analysis: Forecasting and Control. Wiley.
3. Breiman, L. Random Forests (2001). Machine Learning, 45(1), 5-32.
4. Cục Thống kê (2023). Niên giám Thống kê Việt Nam.
5. Cục Hàng hải Việt Nam (2022). Số liệu sản lượng hàng hóa qua cảng biển Việt Nam giai đoạn 2015-2022. Nxb Giao thông Vận tải.
6. Diebold, F. X., & Mariano, R. S. (1995). Comparing predictive accuracy. J. Business & Econ. Statistics, 13(3), 253-263.
7. Molnar, C. (2022). Interpretable Machine Learning (2nd ed.).
8. Nguyễn, T. H., & Trần, Q. K. (2023). Ứng dụng ARIMA dự báo chỉ số chi phí logistics. Tạp chí Kinh tế và Dự báo, 12(9), 45-58.
9. Phạm, M. T (2021). Đánh giá hiệu quả logistics Việt Nam. Tạp chí Phát triển Kinh tế, 32(4), 67-81.
10. Zhang, X., & Chen, Y. (2020). Forecasting freight logistics cost via RF and ARIMA. TR Part E, 138, 101939.
| Ngày nhận bài: 1/12/2025; Ngày hoàn thiện biên tập: 20/1/2026; Ngày duyệt đăng: 27/1/2026 |
Các tin khác
Các yếu tố ảnh hưởng đến ý định chuyển đổi từ xe máy xăng sang xe máy điện của sinh viên ngoại tỉnh tại Hà Nội
Phát triển doanh nghiệp logistics tại Việt Nam: Thực trạng và kiến nghị
Chia sẻ tri thức, phong cách lãnh đạo và hành vi làm việc đổi mới của nhân viên ngành du lịch - lữ hành Hà Nội
Ảnh hưởng của công bố thông tin ESG đến năng lực huy động vốn và hiệu quả tài chính của các doanh nghiệp thủy sản xuất khẩu tại Việt Nam
Thực trạng các yếu tố ảnh hưởng đến hỗ trợ của doanh nghiệp nhỏ và vừa do phụ nữ làm chủ trên địa bàn TP. Hà Nội và giải pháp tăng cường hỗ trợ
Ảnh hưởng của chất lượng tương tác doanh nghiệp đến kiến thức nghề nghiệp và niềm tin năng lực bản thân của sinh viên: Nghiên cứu tại Trường Cao đẳng Dược Hà Nội
Nguồn lực công nghệ trong các ngành công nghiệp sáng tạo Việt Nam: Từ ứng dụng đến làm chủ công nghệ
Yếu tố ảnh hưởng đến ý định sử dụng xe buýt điện của học sinh, sinh viên tại TP. Hồ Chí Minh
Chính sách quản lý về phát triển chính quyền số tại Hà Tĩnh: Thực trạng và giải pháp