Nguyen Mai Hong Tram

Tôi nghiên cứu cách AI hiểu hành động, thời gian và sự tương tác.

Hướng nghiên cứu của tôi đi từ thị giác máy tính và hỏi đáp hình ảnh y khoa đến hiểu dữ liệu đa phương thức và video. Gần đây, tôi tập trung vào việc định vị hành động theo thời gian trong video góc nhìn thứ nhất.

Học đa phương thức / Hiểu video / Hành động và tương tác

Từ nhận thức đến hành động

Năm câu hỏi nối tiếp nhau cho thấy quá trình phát triển mối quan tâm nghiên cứu của tôi. Câu hỏi cuối là định hướng tương lai, chưa phải một dự án đã hoàn thành.

Làm thế nào để mô hình trích xuất thông tin có cấu trúc một cách tin cậy từ cảnh ảnh phức tạp?

Nghiên cứu ban đầu về phát hiện và nhận dạng chữ trong ảnh tiếng Việt đã khơi gợi mối quan tâm của tôi đối với biểu diễn thị giác vững chắc.

Quan hệ tường minh giữa các đối tượng có thể cải thiện khả năng hỏi đáp hình ảnh phẫu thuật không?

Tôi phát triển GNN-SurgVQA từ xác định bài toán, xây dựng mô hình, đánh giá đến viết bản thảo.

Làm thế nào để mô hình hiểu cử chỉ diễn biến theo thời gian thay vì chỉ nhìn các khung hình tĩnh?

Tại TMA Solutions, tôi nghiên cứu nhận dạng ngôn ngữ ký hiệu liên tục và tạo avatar 3D từ văn bản. Công việc này đưa tôi đến với các hành động theo chuỗi.

Mô hình thị giác–ngôn ngữ nên biểu diễn các hành động diễn ra theo thời gian như thế nào?

Tại VinRobotics, tôi phát triển và đánh giá các quy trình VLM nhiều giai đoạn để mô tả hành động có định vị thời gian trong video góc nhìn thứ nhất.

Làm thế nào để mô hình đa phương thức hiểu hành động và tương tác đủ sâu để hỗ trợ tác tử thông minh?

Hướng quan tâm hiện tại của tôi mở rộng sang AI lấy hành động làm trung tâm và trí tuệ hiện thân, bao gồm nghiên cứu VLM và VLA.

Nhận thức thị giác

Làm thế nào để mô hình trích xuất thông tin có cấu trúc một cách tin cậy từ cảnh ảnh phức tạp?

Từ nhận biết điều nhìn thấy đến hiểu điều đang diễn ra.

Những câu hỏi tôi muốn tiếp tục theo đuổi

Các mối quan tâm này nối kết công việc trước đây với hướng nghiên cứu tôi muốn theo đuổi tiếp theo.

Học đa phương thức

Kết nối thông tin thị giác với ngôn ngữ và suy luận giữa nhiều phương thức.

Hiểu video và thời gian

Nghiên cứu hành động, thứ tự thời gian và định vị trong video góc nhìn thứ nhất.

Trí tuệ lấy hành động làm trung tâm

Tìm hiểu các mô hình có thể hiểu tương tác và hỗ trợ tác tử hiện thân.

Nghiên cứu tiêu biểu

Câu hỏi nghiên cứu, phần việc tôi thực hiện và kết quả hoặc bài học từ từng dự án.

Suy luận đa phương thức lấy đối tượng làm trung tâmICDAM 2026 · Best Paper · bài báo đã được chấp nhận, chưa công bố

GNN-SurgVQA

Quan hệ tường minh giữa các đối tượng có thể cải thiện khả năng hỏi đáp hình ảnh phẫu thuật không?

Đóng góp của tôi

Tôi thực hiện nghiên cứu từ xác định bài toán, chuẩn bị dữ liệu, phát triển mô hình, đánh giá đến viết bản thảo.

Kết quả và bài học

Trên SSG-VQA, bộ dữ liệu khoảng 960 nghìn cặp hỏi–đáp, mô hình đạt độ chính xác 85,9% và F1 có trọng số 85,8% trên tập kiểm thử visual oracle gồm 77.198 câu hỏi.

Thiết lập visual oracle dùng các hộp giới hạn có sẵn trong SSG-VQA, thay vì dự đoán từ bộ phát hiện YOLOv8 đã tinh chỉnh.

Xem mã nguồn công khai
Video góc nhìn thứ nhất tại VinRoboticsThực tập nghiên cứu · VinRobotics

Hiểu hành động với định vị thời gian

Mô hình thị giác–ngôn ngữ nên biểu diễn các hành động diễn ra theo thời gian như thế nào?

Đóng góp của tôi

Tôi phát triển và đánh giá các quy trình thị giác–ngôn ngữ nhiều giai đoạn; thiết kế thí nghiệm có kiểm soát về lấy mẫu khung hình, định vị thời gian, prompt và điều chỉnh mô hình.

Kết quả và bài học

Tôi phân tích sự mơ hồ về hướng, chênh lệch dữ liệu và hiện tượng quá khớp; đồng thời khảo sát các phương pháp VLM/VLA gần đây qua tài liệu và thí nghiệm quy mô lớn với SGLang.

Thực tập nghiên cứu, nhóm AI Platform VLA, tháng 7–8/2026.

Một hướng nghiên cứu song song

Ra quyết định bằng toán học trong những ràng buộc thực tế.

Vận chuyển máu khẩn cấp

Làm thế nào để cân bằng chi phí và thời gian chờ của bệnh viện trong điều kiện vận hành thực tế?

Tôi mô hình hóa bài toán định tuyến xe điện đa mục tiêu với trạm đổi pin và khung thời gian, rồi phát triển các phương pháp lai NSGA-II và SPEA2 kết hợp Savings, 2-opt và 3-opt.

Đánh giá trên bộ chuẩn EVRP-TW và nghiên cứu tình huống tại Thành phố Hồ Chí Minh gồm 36 bệnh viện và 6 trạm đổi pin.

Giải B Nghiên cứu khoa học sinh viên UEH · Bán kết Eureka 2025

Xem mã nguồn công khai

Công bố khoa học

Các công trình đã xuất bản hoặc được chấp nhận, kèm liên kết công khai khi có.

2026

GNN-SurgVQA: Object-Centric Graph Reasoning for Visual Question Answering in Laparoscopic Scene Understanding

International Conference on Data Analytics and Management (ICDAM)

Best Paper · đã được chấp nhận, bài báo chưa công bố

Mã nguồn công khai
2025

Comprehensive Approach to Vietnamese Scene Text Recognition: Challenges, Models, and Framework Development

ICDAM 2025 · Lecture Notes in Networks and Systems, vol. 1601 · Springer

Đã xuất bản

Đọc bài báo

Kinh nghiệm

Công việc nghiên cứu và kỹ thuật về thị giác, ngôn ngữ và hiểu dữ liệu theo chuỗi.

Tháng 7–8/2026

Thực tập sinh nghiên cứu AI

VinRobotics · AI Platform, VLA Team

Mô tả hành động có định vị thời gian trong video góc nhìn thứ nhất, với các thí nghiệm có kiểm soát về lấy mẫu, định vị, prompt và điều chỉnh mô hình.

Tháng 3–5/2026

Thực tập sinh kỹ sư nghiên cứu AI

TMA Solutions

Nghiên cứu giao tiếp hai chiều bằng ngôn ngữ ký hiệu và suy luận trên trình duyệt với PyTorch và ONNX Runtime Web.

Tháng 3/2025–1/2026

Cộng tác viên nghiên cứu

Đại học Kinh tế Thành phố Hồ Chí Minh

Nghiên cứu hỏi đáp hình ảnh phẫu thuật, nhận dạng chữ trong ảnh tiếng Việt và tối ưu hóa đa mục tiêu qua toàn bộ quy trình nghiên cứu.

Dự án khác

Các hệ thống ứng dụng bên cạnh danh mục nghiên cứu.

GradeMind

Hỗ trợ chấm bài Toán bằng AI

Dự án cuối khóa Chương trình Tài năng AI ứng dụng Vingroup × VinUniversity

Hệ thống chấm Toán trung học với giáo viên trong vòng kiểm soát, phản hồi dựa trên bằng chứng, phân tích lỗi theo lớp, phân luồng theo độ tin cậy và bảo vệ thông tin cá nhân.

Xem bản demo

Học vấn và chương trình

Cử nhân Khoa học dữ liệu

Đại học Kinh tế Thành phố Hồ Chí Minh

Tháng 9/2022–3/2026

3.92 / 4.00GPA

Hạng 2 ngành Khoa học dữ liệuTop 5% Khoa Công nghệ Thông tin Kinh doanh

  • Chương trình Tài năng AI ứng dụng Vingroup × VinUniversity, tháng 5–8/2026
  • AI Vietnam AIO2026, tháng 6/2026–nay