← Tất cả bài viết

Cách tiết kiệm token khi làm việc với AI mà không làm giảm chất lượng

4 phút đọc

Khi dùng AI nhiều cho các dự án thực tế, mình bắt đầu để ý một vấn đề: context càng dài thì chi phí sử dụng càng tăng và cuộc hội thoại càng dễ loãng.

Mình không cố tiết kiệm token bằng cách viết prompt ngắn đi.

Mình cố tìm và bỏ context không còn giá trị.

1. Chia task lớn thành từng task nhỏ rõ ràng

Thay vì đưa một codebase lớn rồi yêu cầu AI "làm hoàn hảo", mình tách thành từng bước có đầu ra cụ thể.

  1. Đọc spec và liệt kê file cần sửa.
  2. Implement một feature.
  3. Chạy test.
  4. Review diff.

Mỗi bước có ít context hơn và dễ kiểm tra hơn.

2. Đưa đúng file, không đưa cả thế giới

Nếu lỗi chỉ nằm ở một module, mình ưu tiên chỉ gửi file liên quan, log lỗi và interface phụ thuộc trực tiếp.

Chỉ mở rộng context khi AI thực sự thiếu thông tin.

3. Dùng tài liệu ngắn làm "Source of Truth"

Một README.md, Project_Spec.md hoặc style guide tốt giúp mình không phải giải thích lại project trong mỗi prompt.

Nhưng tài liệu cũng phải được cắt gọn. Nếu spec bị outdated, AI sẽ tốn token để đọc cả thứ mình không còn dùng.

4. Bắt đầu cuộc hội thoại mới khi chuyển sang vấn đề khác

Có những chat kéo dài đến mức AI bắt đầu dựa vào quyết định cũ hoặc nhầm giữa nhiều phiên bản.

Khi đó mình thường tạo chat mới và nếu cần thiết có thể cung cấp một bản tóm tắt các vấn đề đã xử lý và còn tồn đọng.

5. Đừng yêu cầu output dài hơn nhu cầu

Nếu chỉ cần danh sách các file đã sửa, mình không yêu cầu AI giải thích 2.000 từ.

Nếu chỉ cần AI viết các test case quan trọng, mình sẽ nói rõ số lượng và phạm vi.

Tiết kiệm token không phải mục tiêu cuối

Nếu cắt context đến mức AI hiểu sai, mình sẽ mất nhiều thời gian và token để sửa hơn số token tiết kiệm được.

Nguyên tắc mình đang dùng là:

Cung cấp đủ context để làm đúng task hiện tại, không mang theo context chỉ vì "có thể sẽ cần".

Prompt ngắn chưa chắc tiết kiệm nếu task vẫn rộng. Điều quan trọng hơn là giao đúng phạm vi, đúng context và đúng mức chất lượng cần thiết.