Nguyen Mai Hong Tram

Tôi xây dựng hệ thống AI đa phương thức cho công việc thực tế.

Tôi làm việc với OCR, mô hình ngôn ngữ, truy xuất thông tin, suy luận thị giác và suy luận trên trình duyệt — từ triển khai, đánh giá đến đưa vào sử dụng.

OCR / RAG / VLM / Browser inference

Dự án tiêu biểu

Những hệ thống tôi xây dựng, các lựa chọn kỹ thuật và bằng chứng có thể xem công khai.

GradeMind

Hỗ trợ chấm bài Toán bằng AI

Mở demo công khai

Bài toán

Giúp giáo viên xem lại bài Toán trung học với phản hồi nháp dựa trên bằng chứng và phân tích lỗi ở cấp lớp.

Phần việc tôi thực hiện

Tôi trực tiếp xây dựng luồng OCR, tích hợp LLM API, RAG và frontend; đồng thời phụ trách quản lý dự án và tài liệu.

Giải pháp kỹ thuật

Quy trình có giáo viên kiểm duyệt kết hợp chấm bài đa phương thức, truy xuất có nguồn, phân luồng theo độ tin cậy, kiểm tra trích dẫn, bảo vệ dữ liệu cá nhân và rà soát của con người.

Bằng chứng

Demo capstone công khai cho thấy quy trình sản phẩm; hệ thống cũng dùng bộ mẫu chuẩn để đánh giá.

  • OCR
  • LLM API
  • RAG
  • FastAPI
  • PostgreSQL/pgvector
  • React/TypeScript

Suy luận ngôn ngữ ký hiệu trên trình duyệt

TMA Solutions · thực tập kỹ sư AI

Bài toán

Đưa nhận dạng ngôn ngữ ký hiệu liên tục vào môi trường trình duyệt theo thời gian thực.

Phần việc tôi thực hiện

Tôi nghiên cứu nhận dạng ngôn ngữ ký hiệu liên tục và tạo avatar 3D từ văn bản, rồi xây dựng luồng suy luận từ mô hình PyTorch đến trình duyệt.

Giải pháp kỹ thuật

Chuyển suy luận mô hình sang ONNX Runtime Web và tích hợp thành một quy trình chạy trên trình duyệt.

Bằng chứng

Quy trình được đánh giá trong bối cảnh trò chuyện video theo thời gian thực.

  • PyTorch
  • ONNX Runtime Web
  • Browser inference

GNN-SurgVQA

Hỏi đáp hình ảnh phẫu thuật đa phương thức

Xem mã nguồn công khai

Bài toán

Quan hệ tường minh giữa các đối tượng có thể cải thiện khả năng hỏi đáp hình ảnh phẫu thuật không?

Phần việc tôi thực hiện

Tôi thực hiện nghiên cứu từ xác định bài toán, chuẩn bị dữ liệu, phát triển mô hình, đánh giá đến viết bản thảo.

Giải pháp kỹ thuật

Kết hợp biểu diễn thị giác, xử lý ngôn ngữ và suy luận đồ thị về quan hệ giữa các đối tượng trong một quy trình VQA đầu cuối.

Bằng chứng

Trên SSG-VQA, bộ dữ liệu khoảng 960 nghìn cặp hỏi–đáp, mô hình đạt độ chính xác 85,9% và F1 có trọng số 85,8% trên tập kiểm thử visual oracle gồm 77.198 câu hỏi.

  • PyTorch
  • PyTorch Geometric
  • Model evaluation

Quy trình dự báo chất lượng không khí

Bản thử nghiệm dự báo · đồ án nhóm tại UEH

Xem mã nguồn công khai

Bài toán

Dự báo chất lượng không khí từ dữ liệu OpenAQ và cung cấp kết quả qua API cùng bảng theo dõi.

Phần việc tôi thực hiện

Tôi trực tiếp triển khai toàn bộ phần kỹ thuật: thu thập và xử lý dữ liệu OpenAQ, huấn luyện RNN/LSTM/GRU, suy luận qua FastAPI, bảng theo dõi Streamlit và đóng gói Docker.

Giải pháp kỹ thuật

So sánh các mô hình dự báo chuỗi thời gian rồi kết nối suy luận với bảng theo dõi qua API được đóng gói bằng container.

Bằng chứng

Repo công khai có mã nguồn, hướng dẫn chạy và đánh giá mô hình. Demo trực tuyến hiện không còn hoạt động.

  • OpenAQ
  • PyTorch
  • RNN/LSTM/GRU
  • FastAPI
  • Streamlit
  • Docker
Xem CV kỹ sư

Kinh nghiệm kỹ thuật

Công việc ứng dụng về quy trình đa phương thức, hiểu video và suy luận trên trình duyệt.

Tháng 7–8/2026

Thực tập sinh nghiên cứu AI

VinRobotics · AI Platform, VLA Team

Mô tả hành động có định vị thời gian trong video góc nhìn thứ nhất, với các thí nghiệm có kiểm soát về lấy mẫu, định vị, prompt và điều chỉnh mô hình.

Tháng 3–5/2026

Thực tập sinh kỹ sư nghiên cứu AI

TMA Solutions

Nghiên cứu giao tiếp hai chiều bằng ngôn ngữ ký hiệu và suy luận trên trình duyệt với PyTorch và ONNX Runtime Web.

Cách tôi làm việc

Công cụ được đặt trong bối cảnh các hệ thống mà chúng giúp tôi xây dựng.

AI ứng dụng

OCR, LLM API, RAG và quy trình đa phương thức trong GradeMind.

Phát triển mô hình

PyTorch, quy trình thị giác–ngôn ngữ, suy luận đồ thị và đánh giá có kiểm soát.

Suy luận và triển khai

ONNX Runtime Web, SGLang, FastAPI, PostgreSQL/pgvector và Docker.

Nền tảng nghiên cứu

Công bố và ghi nhận đã góp phần định hình cách tôi làm kỹ thuật.

2026

GNN-SurgVQA: Object-Centric Graph Reasoning for Visual Question Answering in Laparoscopic Scene Understanding

International Conference on Data Analytics and Management (ICDAM) · Best Paper · đã được chấp nhận, bài báo chưa công bố

Mã nguồn công khai

2025

Comprehensive Approach to Vietnamese Scene Text Recognition: Challenges, Models, and Framework Development

ICDAM 2025 · Lecture Notes in Networks and Systems, vol. 1601 · Springer · Đã xuất bản

Đọc bài báo