ĐIỂM TIN AI NÓNG - 19/06/2026
Model Releases & Đột phá Công nghệ
- Bosun v1.1 (Hanno Labs / Hugging Face): Bosun v1.1 được giới thiệu như một "programmable relational judge" cho bài toán so sánh, suy luận quan hệ và làm sạch knowledge graph. Bản cập nhật mới thêm khả năng hiểu quan hệ có hướng như "B thay thế A" hoặc "B phụ thuộc A", thay vì chỉ chấm độ giống đối xứng. Theo bài công bố,
Bosun-4B v1.1đạt0.91 AUROCtrênPAWS,0.85trêne-CARE, và0.57trênANLI; riêngBosun-XScỡ0.6Bvẫn đạt0.90trênPAWS. Với đội ngũ xây agent hoặc retrieval pipeline, điểm đáng chú ý là mô hình này nhắm thẳng vào lớp đánh giá có điều khiển bằng rule sentence, không chỉ chat chung chung. Nguồn: Hugging Face.
Cập nhật Sản phẩm & Công cụ
- ChatGPT Enterprise spend controls (OpenAI): OpenAI bổ sung analytics và spend controls mới cho
ChatGPT Enterprise, gom usage củaChatGPTvàCodexvào cùngGlobal Admin Console. Admin giờ có thể xem credit usage theo user, product và model, đồng thời đọc dữ liệu tương tự quaCost APIđể nối vào hệ thống nội bộ. Về workflow, đây là nâng cấp thực dụng cho các nhóm đang rollout AI rộng trong doanh nghiệp vì nó biến chi phí agent/model từ "hộp đen" thành dữ liệu có thể phân tích và giới hạn theo nhóm hoặc cá nhân. Nguồn: OpenAI. - Copilot code review đọc
AGENTS.md(GitHub): GitHub cập nhậtCopilot code reviewđể tự đọc fileAGENTS.mdở root repo và dùng các chỉ dẫn phù hợp khi sinh review feedback. Họ cũng thêm nútRequestngay trên draft pull request để gọi review nhanh hơn và gộp bớt một số timeline events cho đỡ nhiễu. Tác động thực tế với developer là phần hướng dẫn review style/expectation có thể được đặt chung trong repo và đi thẳng vào luồng review AI thay vì phải lặp lại trong prompt ad hoc. Nguồn: GitHub Changelog.
Nghiên cứu & Học thuật (Báo cáo nổi bật)
- OpenAI rare-disease reanalysis: OpenAI công bố một nghiên cứu ứng dụng trên
NEJM AIvề việc dùngo3 Deep Researchđể rà soát lại376ca bệnh di truyền hiếm chưa có lời giải. Sau expert review và xác nhận lâm sàng, nhóm nghiên cứu tìm thêm18chẩn đoán, tương đương4.8%diagnostic yield bổ sung trên tập ca vốn đã được chuyên gia xem nhiều lần; trong giai đoạn tinh chỉnh workflow, hệ thống cũng khôi phục đúng gene/variant ở48/51ca đã biết đáp án. Ý nghĩa kỹ thuật không nằm ở "AI tự chẩn đoán", mà ở việc model tạo ra hypothesis có dẫn chứng để chuyên gia kiểm tra lại trong quy trình chuẩn. Nguồn: OpenAI. - MosaicLeaks (ServiceNow trên Hugging Face): MosaicLeaks nghiên cứu rò rỉ riêng tư trong deep-research agents khi truy vấn web vô tình làm lộ dữ liệu nội bộ qua nhiều bước tìm kiếm. Bộ bài toán gồm
1,001chuỗi multi-hop; kết quả cơ sở cho thấy agentQwen3-4Bcó48.7%strict chain success nhưng bị34.0%answer/full-information leakage. Khi chỉ tối ưu task reward, hiệu năng tăng lên59.3%nhưng leakage cũng tăng lên51.7%; còn phương phápPA-DRgiữ success ở58.7%đồng thời kéo leakage xuống9.9%. Đây là tín hiệu mạnh cho thấy agent safety trong tool use cần reward design riêng, không thể chỉ dặn trong prompt. Nguồn: Hugging Face.
🏷️ Từ khóa Xu hướng (Keywords)
agent-evals, enterprise-ai-governance, privacy-aware-agents
