Nguyen Mai Hong Tram
Tôi xây dựng hệ thống AI đa phương thức cho công việc thực tế.
Tôi làm việc với OCR, mô hình ngôn ngữ, truy xuất thông tin, suy luận thị giác và suy luận trên trình duyệt — từ triển khai, đánh giá đến đưa vào sử dụng.
Dự án tiêu biểu
Những hệ thống tôi xây dựng, các lựa chọn kỹ thuật và bằng chứng có thể xem công khai.
Bài toán
Giúp giáo viên xem lại bài Toán trung học với phản hồi nháp dựa trên bằng chứng và phân tích lỗi ở cấp lớp.
Phần việc tôi thực hiện
Tôi trực tiếp xây dựng luồng OCR, tích hợp LLM API, RAG và frontend; đồng thời phụ trách quản lý dự án và tài liệu.
Giải pháp kỹ thuật
Quy trình có giáo viên kiểm duyệt kết hợp chấm bài đa phương thức, truy xuất có nguồn, phân luồng theo độ tin cậy, kiểm tra trích dẫn, bảo vệ dữ liệu cá nhân và rà soát của con người.
Bằng chứng
Demo capstone công khai cho thấy quy trình sản phẩm; hệ thống cũng dùng bộ mẫu chuẩn để đánh giá.
Suy luận ngôn ngữ ký hiệu trên trình duyệt
TMA Solutions · thực tập kỹ sư AI
Bài toán
Đưa nhận dạng ngôn ngữ ký hiệu liên tục vào môi trường trình duyệt theo thời gian thực.
Phần việc tôi thực hiện
Tôi nghiên cứu nhận dạng ngôn ngữ ký hiệu liên tục và tạo avatar 3D từ văn bản, rồi xây dựng luồng suy luận từ mô hình PyTorch đến trình duyệt.
Giải pháp kỹ thuật
Chuyển suy luận mô hình sang ONNX Runtime Web và tích hợp thành một quy trình chạy trên trình duyệt.
Bằng chứng
Quy trình được đánh giá trong bối cảnh trò chuyện video theo thời gian thực.
Bài toán
Quan hệ tường minh giữa các đối tượng có thể cải thiện khả năng hỏi đáp hình ảnh phẫu thuật không?
Phần việc tôi thực hiện
Tôi thực hiện nghiên cứu từ xác định bài toán, chuẩn bị dữ liệu, phát triển mô hình, đánh giá đến viết bản thảo.
Giải pháp kỹ thuật
Kết hợp biểu diễn thị giác, xử lý ngôn ngữ và suy luận đồ thị về quan hệ giữa các đối tượng trong một quy trình VQA đầu cuối.
Bằng chứng
Trên SSG-VQA, bộ dữ liệu khoảng 960 nghìn cặp hỏi–đáp, mô hình đạt độ chính xác 85,9% và F1 có trọng số 85,8% trên tập kiểm thử visual oracle gồm 77.198 câu hỏi.
Bài toán
Dự báo chất lượng không khí từ dữ liệu OpenAQ và cung cấp kết quả qua API cùng bảng theo dõi.
Phần việc tôi thực hiện
Tôi trực tiếp triển khai toàn bộ phần kỹ thuật: thu thập và xử lý dữ liệu OpenAQ, huấn luyện RNN/LSTM/GRU, suy luận qua FastAPI, bảng theo dõi Streamlit và đóng gói Docker.
Giải pháp kỹ thuật
So sánh các mô hình dự báo chuỗi thời gian rồi kết nối suy luận với bảng theo dõi qua API được đóng gói bằng container.
Bằng chứng
Repo công khai có mã nguồn, hướng dẫn chạy và đánh giá mô hình. Demo trực tuyến hiện không còn hoạt động.
Xem CV kỹ sư ↗Kinh nghiệm kỹ thuật
Công việc ứng dụng về quy trình đa phương thức, hiểu video và suy luận trên trình duyệt.
Tháng 7–8/2026
Thực tập sinh nghiên cứu AI
VinRobotics · AI Platform, VLA Team
Mô tả hành động có định vị thời gian trong video góc nhìn thứ nhất, với các thí nghiệm có kiểm soát về lấy mẫu, định vị, prompt và điều chỉnh mô hình.
Tháng 3–5/2026
Thực tập sinh kỹ sư nghiên cứu AI
TMA Solutions
Nghiên cứu giao tiếp hai chiều bằng ngôn ngữ ký hiệu và suy luận trên trình duyệt với PyTorch và ONNX Runtime Web.
Cách tôi làm việc
Công cụ được đặt trong bối cảnh các hệ thống mà chúng giúp tôi xây dựng.
AI ứng dụng
OCR, LLM API, RAG và quy trình đa phương thức trong GradeMind.
Phát triển mô hình
PyTorch, quy trình thị giác–ngôn ngữ, suy luận đồ thị và đánh giá có kiểm soát.
Suy luận và triển khai
ONNX Runtime Web, SGLang, FastAPI, PostgreSQL/pgvector và Docker.
Nền tảng nghiên cứu
Công bố và ghi nhận đã góp phần định hình cách tôi làm kỹ thuật.
2026
GNN-SurgVQA: Object-Centric Graph Reasoning for Visual Question Answering in Laparoscopic Scene Understanding
International Conference on Data Analytics and Management (ICDAM) · Best Paper · đã được chấp nhận, bài báo chưa công bố
Mã nguồn công khai ↗2025
Comprehensive Approach to Vietnamese Scene Text Recognition: Challenges, Models, and Framework Development
ICDAM 2025 · Lecture Notes in Networks and Systems, vol. 1601 · Springer · Đã xuất bản
Đọc bài báo ↗