Skip to content

ĐIỂM TIN AI NÓNG - 18/06/2026

Model Releases & Đột phá Công nghệ

  • GLM-5.2 (Z.AI): Z.AI ra mắt GLM-5.2 như model chủ lực cho các tác vụ dài hơi, nhấn mạnh context ổn định tới 1M token thay vì chỉ tăng giới hạn danh nghĩa. Theo bài công bố chính thức, model này là open source giấy phép MIT, dùng IndexShare để giảm FLOPs mỗi token tới 2.9x ở ngữ cảnh 1M và cải thiện speculative decoding với mức tăng acceptance length tới 20%. Trên benchmark code, GLM-5.2 đạt 81.0Terminal-Bench 2.162.1SWE-bench Pro, cao hơn rõ rệt so với GLM-5.1 (63.558.4), đồng thời được mô tả là model nguồn mở xếp hạng cao nhất trên ba benchmark long-horizon coding trong bài giới thiệu. Nguồn: Hugging Face Blog.

Cập nhật Sản phẩm & Công cụ

  • Agentic Resource Discovery - ARD (Hugging Face): Hugging Face giới thiệu lớp discovery cho agent, cho phép tìm tools, skillsagents bằng truy vấn ngôn ngữ tự nhiên thay vì cài sẵn từng MCP server hay catalog thủ công. Điểm đáng chú ý về mặt workflow là ARD tách bước chọn công cụ ra khỏi context window của LLM, dùng registry và search để agent tìm capability tại runtime; điều này phù hợp với hệ sinh thái agent đang mở rộng rất nhanh. Hugging Face hiện dùng Discover Tool như reference implementation, hỗ trợ tìm qua hàng nghìn Skills, Spaces và MCP servers. Nguồn: Hugging Face Blog.
  • eve (Vercel): Vercel công bố eve, một framework mã nguồn mở để xây dựng và vận hành agent theo mô hình "filesystem-first": một agent chỉ là thư mục gồm instructions, tools, skills, subagents, channelsschedules. Giá trị thực tế với developer nằm ở việc framework này đóng gói sẵn các phần khó triển khai production như durable execution, sandboxed compute, human-in-the-loop approvals và evals, giúp giảm phần "plumbing" vốn thường bị tự triển khai lặp lại giữa các dự án agent. Nếu đội ngũ đang thử agent backend nghiêm túc, đây là tín hiệu cho thấy hạ tầng agent đang được đóng gói theo hướng giống framework web giai đoạn đầu. Nguồn: Vercel Blog, GitHub.

Nghiên cứu & Học thuật (Báo cáo nổi bật)

  • Deployment Simulation (OpenAI): OpenAI công bố phương pháp Deployment Simulation để ước lượng hành vi không mong muốn của model trước khi phát hành bằng cách phát lại các hội thoại cũ theo cách bảo toàn riêng tư với model ứng viên. Điểm kỹ thuật quan trọng là phương pháp này dùng ngữ cảnh hội thoại thực tế thay vì bộ prompt kiểm thử tổng hợp, nhằm giảm hiện tượng model "biết mình đang bị test" và cải thiện ước lượng rủi ro khi triển khai thật. OpenAI cho biết họ đã áp dụng cách này trên nhiều đợt triển khai dòng GPT-5 và cả các rollout có dùng tool, đồng thời nhấn mạnh giới hạn hiện tại là khó đo các hành vi xảy ra hiếm hơn khoảng 1/200,000 tin nhắn. Nguồn: OpenAI, paper PDF.
  • LifeSciBench (OpenAI): OpenAI cũng giới thiệu LifeSciBench, một benchmark đánh giá khả năng hỗ trợ công việc nghiên cứu khoa học sự sống thực tế thay vì chỉ trả lời câu hỏi sinh học dạng hẹp. Bộ đánh giá này gồm 750 tác vụ do chuyên gia viết, trải trên 7 workflow và 7 domain sinh học, kèm 1,062 artifacts, 19,020 rubric criteria và đóng góp từ 173 nhà khoa học với 453 expert reviewers. Với người làm AI ứng dụng, đây là dấu hiệu rõ rằng benchmark đang dịch chuyển từ QA tĩnh sang workflow-based evaluation có ngữ cảnh nghề nghiệp cụ thể hơn. Nguồn: OpenAI.

🏷️ Từ khóa Xu hướng (Keywords)

long-horizon-agents, agent-discovery, pre-deployment-evals