Skip to content

ĐIỂM TIN AI NÓNG - 16/06/2026

Model Releases & Đột phá Công nghệ

  • Z.ai - GLM-5.2: Trong cửa sổ 24 giờ qua, đây là model release đáng chú ý nhất ở nhóm dev tooling, dù chưa phải một đợt ra mắt tier-1 từ OpenAI, Anthropic hay Google. Bản phát hành này được mô tả có ngữ cảnh 1M token, tối đa 131,072 output token, có hai mức suy luận HighMax, đồng thời tương thích endpoint kiểu Anthropic nên có thể gắn nhanh vào Claude Code, Cline hoặc OpenClaw. Điểm quan trọng là hãng chưa công bố benchmark lúc ra mắt, nên đây là bản cập nhật đáng theo dõi hơn là một model đã được chứng minh về chất lượng trong production. Nguồn MarkTechPost Nguồn tài liệu Z.ai

Cập nhật Sản phẩm & Công cụ

  • Sakana AI - Marlin: Sakana AI công bố sản phẩm thương mại đầu tiên vào ngày 15/06/2026, định vị như một trợ lý nghiên cứu tự động cho doanh nghiệp. Theo công bố chính thức, Marlin có thể tự nghiên cứu liên tục tới khoảng 8 giờ cho mỗi chủ đề rồi xuất ra slide tóm tắt có cấu trúc và báo cáo nhiều trang. Với workflow thực chiến, đây là tín hiệu rõ rằng các hãng không chỉ bán model nữa mà đang đóng gói hẳn agent theo use case nghiên cứu chiến lược và due diligence. Nguồn Sakana AI Nguồn blog Sakana AI
  • Anthropic - giữ nguyên billing cho Agent SDK: Tin tác động trực tiếp tới developer dùng claude -p, Agent SDK và app bên thứ ba là Anthropic đã tạm dừng kế hoạch tách chi phí các luồng này khỏi subscription limit. Điều đó có nghĩa là trước mắt workflow hiện tại của người dùng Pro, Max và Enterprise chưa bị ép sang mô hình credit riêng hay usage-based pricing. Với team đang build tool trên hệ Claude, đây là cập nhật quan trọng vì nó giảm rủi ro chi phí đột ngột trong ngắn hạn. Nguồn The Decoder

Nghiên cứu & Học thuật (Báo cáo nổi bật)

  • TokenPilot: Paper mới trên arXiv ngày 16/06/2026 tập trung đúng bài toán đau đầu của agent dài hơi: context phình ra làm tăng chi phí và phá cache prefix. Nhóm tác giả đề xuất khung quản lý ngữ cảnh hai lớp gồm Ingestion-Aware Compaction ở mức toàn cục và Lifecycle-Aware Eviction ở mức cục bộ để giữ cache continuity tốt hơn thay vì chỉ cắt bừa token. Trên PinchBench và Claw-Eval, paper báo giảm chi phí 61%56% ở isolated mode, và 61% cùng 87% ở continuous mode mà vẫn giữ hiệu năng cạnh tranh. Đây là hướng rất đáng quan tâm cho agent coding, research agent, và bất kỳ hệ nào chạy session dài. Nguồn arXiv
  • Benchmark đo mức dễ bị thao túng bởi tuyên truyền: The Decoder đưa tin ngày 16/06/2026 về một benchmark mới từ Institute of the Estonian Language, kiểm tra 60 mô hình với 75 câu hỏi trên 14 narrative tuyên truyền bằng 3 ngôn ngữ. Điểm đáng chú ý không nằm ở một model cụ thể, mà ở chỗ benchmark này đo độ bền của model trước prompt mang tính thao túng, một lớp đánh giá sát thực tế hơn nhiều so với benchmark kiến thức tĩnh. Với các team làm moderation, civic AI hoặc search assistant, đây là dạng eval nên theo dõi sát. Nguồn The Decoder

🏷️ Từ khóa Xu hướng (Keywords)

long-context agents, AI research automation, context compaction