ĐIỂM TIN AI NÓNG - 25/06/2026
Model Releases & Đột phá Công nghệ
- Không ghi nhận model release frontier mới từ OpenAI, Anthropic, Google DeepMind và Hugging Face trong cửa sổ quét ngày
25/06/2026: Trong 24 giờ gần nhất, các nguồn ưu tiên không công bố thêm một model tổng quát tầm cỡ như GPT, Claude, Gemini hay một system card mới đủ lớn để đưa vào mục phát hành mô hình. Thay vì có model mới, trọng tâm kỹ thuật hôm nay chuyển sang tầng hạ tầng và benchmark sát deployment hơn. Nguồn đối chiếu: OpenAI News, Anthropic News, Google Research Blog, Hugging Face Blog. - OpenAI / Jalapeno inference chip: OpenAI công bố ngày
24/06/2026chip suy luận tùy biến đầu tiên hợp tác cùng Broadcom, đặt tênJalapeno. Bài công bố nêu rõ đây là một accelerator tối ưu cho suy luận LLM, đã tape-out trong9tháng, đã chạy workload trong lab ở mức tần số và điện năng mục tiêu, trong đó cóGPT-5.3-Codex-Spark; OpenAI cũng cho biết kiểm thử sớm cho thấy hiệu năng trên mỗi watt tốt hơn trạng thái hiện đại. Điều quan trọng với dev và doanh nghiệp là thông điệp chiến lược: OpenAI đang đẩy sâu xuống lớp chip, networking và rack system để hạ chi phí suy luận và tăng độ ổn định cho ChatGPT, Codex và API thay vì chỉ dựa vào model cấp cao hơn. Nguồn: OpenAI - OpenAI and Broadcom unveil LLM-optimized inference chip.
Cập nhật Sản phẩm & Công cụ
- NVIDIA / NeMo AutoModel trên Hugging Face: Bài viết enterprise đăng ngày
24/06/2026mô tả cáchNVIDIA NeMo AutoModelbuild trênTransformers v5để fine-tune MoE mà không đổi APIfrom_pretrained(). Theo số liệu NVIDIA công bố, cách này đạt3.4-3.7xtraining throughput cao hơn và giảm29-32%bộ nhớ GPU so vớiTransformers v5gốc trong bài toán fine-tune MoE. Với team hạ tầng model, điểm đáng chú ý là nó giữ ergonomics quen thuộc của Hugging Face nhưng thêm expert parallelism, DeepEP và TransformerEngine kernels, nên phù hợp cho workflow cần tăng tốc train mà không muốn viết lại stack huấn luyện. Nguồn: Hugging Face - Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel.
Nghiên cứu & Học thuật (Báo cáo nổi bật)
- Google Research / Thinking to Recall: Google Research đăng bài ngày
24/06/2026cho thấy reasoning trace không chỉ giúp bài toán logic phức tạp mà còn có thể mở khóa khả năng nhớ lại sự kiện đơn giản trong LLM. Nhóm tác giả quy về hai cơ chế:computational buffer(thêm token để mở rộng "đường băng" tính toán) vàfactual priming(gợi lại các sự kiện liên quan để kích hoạt đáp án đúng), đồng thời cảnh báo rằng nếu chuỗi trung gian có một fact hallucinated thì khả năng trả lời đúng giảm rõ rệt. Với người xây workflow agent và eval, bài này có giá trị thực dụng vì nó gợi ý cách ưu tiên các reasoning trajectory có fact kiểm chứng được thay vì mặc định tin mọi chuỗi suy nghĩ dài hơn là tốt hơn. Nguồn: Google Research - Thinking to recall: How reasoning unlocks parametric knowledge in LLMs. - Hugging Face / FFASR Leaderboard: Hugging Face và Treble Technologies công bố ngày
24/06/2026leaderboardFFASR, được mô tả là benchmark mở đầu tiên cho far-field ASR trong điều kiện deployment thực tế. Bài viết nêu benchmark này đánh giá trên9điều kiện, trong đó điểm xếp hạng chính hiện tại dựa vào4điều kiện gồm near-field, far-field high SNR, mid SNR và low SNR; nhóm tác giả nhấn mạnh rằng WER far-field low SNR của các model nộp lên hiện cao hơn nhiều lần so với near-field trên cùng nội dung. Với các đội voice agent, meeting transcription và robot, đây là tín hiệu quan trọng vì benchmark này bắt đầu đo đúng khoảng cách giữa demo đẹp và hiệu năng ngoài đời thật. Nguồn: Hugging Face - Introducing the FFASR Leaderboard: Benchmarking ASR in the Real World.
Từ khóa Xu hướng (Keywords)
inference-chip, moe-finetuning, far-field-asr, reasoning-traces, factual-priming
