Skip to content

ĐIỂM TIN AI NÓNG - 19/06/2026

Model Releases & Đột phá Công nghệ

  • Bosun v1.1 (Hanno Labs / Hugging Face): Bosun v1.1 được giới thiệu như một "programmable relational judge" cho bài toán so sánh, suy luận quan hệ và làm sạch knowledge graph. Bản cập nhật mới thêm khả năng hiểu quan hệ có hướng như "B thay thế A" hoặc "B phụ thuộc A", thay vì chỉ chấm độ giống đối xứng. Theo bài công bố, Bosun-4B v1.1 đạt 0.91 AUROC trên PAWS, 0.85 trên e-CARE, và 0.57 trên ANLI; riêng Bosun-XS cỡ 0.6B vẫn đạt 0.90 trên PAWS. Với đội ngũ xây agent hoặc retrieval pipeline, điểm đáng chú ý là mô hình này nhắm thẳng vào lớp đánh giá có điều khiển bằng rule sentence, không chỉ chat chung chung. Nguồn: Hugging Face.

Cập nhật Sản phẩm & Công cụ

  • ChatGPT Enterprise spend controls (OpenAI): OpenAI bổ sung analytics và spend controls mới cho ChatGPT Enterprise, gom usage của ChatGPTCodex vào cùng Global Admin Console. Admin giờ có thể xem credit usage theo user, product và model, đồng thời đọc dữ liệu tương tự qua Cost API để nối vào hệ thống nội bộ. Về workflow, đây là nâng cấp thực dụng cho các nhóm đang rollout AI rộng trong doanh nghiệp vì nó biến chi phí agent/model từ "hộp đen" thành dữ liệu có thể phân tích và giới hạn theo nhóm hoặc cá nhân. Nguồn: OpenAI.
  • Copilot code review đọc AGENTS.md (GitHub): GitHub cập nhật Copilot code review để tự đọc file AGENTS.md ở root repo và dùng các chỉ dẫn phù hợp khi sinh review feedback. Họ cũng thêm nút Request ngay trên draft pull request để gọi review nhanh hơn và gộp bớt một số timeline events cho đỡ nhiễu. Tác động thực tế với developer là phần hướng dẫn review style/expectation có thể được đặt chung trong repo và đi thẳng vào luồng review AI thay vì phải lặp lại trong prompt ad hoc. Nguồn: GitHub Changelog.

Nghiên cứu & Học thuật (Báo cáo nổi bật)

  • OpenAI rare-disease reanalysis: OpenAI công bố một nghiên cứu ứng dụng trên NEJM AI về việc dùng o3 Deep Research để rà soát lại 376 ca bệnh di truyền hiếm chưa có lời giải. Sau expert review và xác nhận lâm sàng, nhóm nghiên cứu tìm thêm 18 chẩn đoán, tương đương 4.8% diagnostic yield bổ sung trên tập ca vốn đã được chuyên gia xem nhiều lần; trong giai đoạn tinh chỉnh workflow, hệ thống cũng khôi phục đúng gene/variant ở 48/51 ca đã biết đáp án. Ý nghĩa kỹ thuật không nằm ở "AI tự chẩn đoán", mà ở việc model tạo ra hypothesis có dẫn chứng để chuyên gia kiểm tra lại trong quy trình chuẩn. Nguồn: OpenAI.
  • MosaicLeaks (ServiceNow trên Hugging Face): MosaicLeaks nghiên cứu rò rỉ riêng tư trong deep-research agents khi truy vấn web vô tình làm lộ dữ liệu nội bộ qua nhiều bước tìm kiếm. Bộ bài toán gồm 1,001 chuỗi multi-hop; kết quả cơ sở cho thấy agent Qwen3-4B48.7% strict chain success nhưng bị 34.0% answer/full-information leakage. Khi chỉ tối ưu task reward, hiệu năng tăng lên 59.3% nhưng leakage cũng tăng lên 51.7%; còn phương pháp PA-DR giữ success ở 58.7% đồng thời kéo leakage xuống 9.9%. Đây là tín hiệu mạnh cho thấy agent safety trong tool use cần reward design riêng, không thể chỉ dặn trong prompt. Nguồn: Hugging Face.

🏷️ Từ khóa Xu hướng (Keywords)

agent-evals, enterprise-ai-governance, privacy-aware-agents