Skip to content

โมเดลและงานวิจัย

โมเดลชั้นนำรุ่นใหม่ เกณฑ์วัดผล วิธีฝึกโมเดล และงานวิจัยเบื้องหลัง

14 บทความ

Google DeepMind ใช้ AI จำลองความทรงจำที่ไม่เคยถูกบันทึกของคู่รักขึ้นใหม่ ใน 'Love, Rendered'

กูเกิล ดีปมายด์ ระบุว่าได้ร่วมมือกับทีมผู้สร้างภาพยนตร์ในการผลิตสารคดีเรื่อง 'Love, Rendered' ซึ่งใช้โมเดลปัญญาประดิษฐ์สำหรับฟื้นฟูภาพเชิงสร้างสรรค์และจับการแสดง เพื่อสร้างความทรงจำขึ้นใหม่ให้กับเบิร์ตและเอเธล แชตซ์ คู่สามีภรรยาที่แต่งงานกันมานานกว่า 70 ปี ซึ่งความทรงจำนี้ไม่เคยถูกถ่ายภาพหรือบันทึกวิดีโอไว้เลย นอกจากนี้ กูเกิลยังระบุด้วยว่าผู้ใช้สามารถฟื้นฟูและลงสีภาพถ่ายครอบครัวได้ด้วยแอปเจมินี (Gemini)

อ่าน 6 นาที

อัพส테จ เปิดตัว Syn Pro โมเดลภาษาใหญ่ (LLM) ภาษาญี่ปุ่น พัฒนาร่วมกับคาราคุริ

อัปสเตจ (Upstage) เปิดตัว Syn Pro โมเดลภาษาขนาดใหญ่สำหรับภาษาญี่ปุ่น ซึ่งพัฒนาร่วมกับบริษัทคาราคุริ (Karakuri Inc.) โดยอัปสเตจระบุว่าโมเดลนี้ครองอันดับหนึ่งในกลุ่มโมเดลภาษาญี่ปุ่นที่ฝึกในประเทศซึ่งมีขนาดต่ำกว่า 3.2 หมื่นล้านพารามิเตอร์ ติดอันดับ 20 อันดับแรกของโลกบนกระดานจัดอันดับ Nejumi Leaderboard และสามารถติดตั้งใช้งานได้ทั้งแบบออนพรีมิส บนคลาวด์ส่วนตัว หรือบนจีพียูของลูกค้าเอง

อ่าน 4 นาที

DeepSeek เปิดตัว V4.1-Flash พร้อมความสามารถเข้าใจภาพแบบเนทีฟ

ดีปซีก (DeepSeek) เปิดตัว V4.1-Flash โมเดลผสมผู้เชี่ยวชาญ (mixture-of-experts) ขนาด 5.52 แสนล้านพารามิเตอร์ ที่มีความสามารถด้านการเข้าใจภาพในตัวโดยกำเนิด บริษัทระบุว่าสถาปัตยกรรมแบบไม่สมมาตรของโมเดลนี้เปิดใช้งาน 8 พันล้านพารามิเตอร์สำหรับข้อมูลนำเข้า และ 1.6 หมื่นล้านพารามิเตอร์สำหรับผลลัพธ์ที่ส่งออก ขณะนี้โมเดลดังกล่าวเปิดให้ใช้งานแล้วผ่าน DeepSeek API ซึ่งมีการปรับโครงสร้างราคาใหม่ทั้งช่วงเวลาเร่งด่วนและช่วงเวลาปกติ

อ่าน 5 นาที

Upstage เปิดตัว Solar Mini โมเดลภาษาโอเพนซอร์สขนาดกะทัดรัด

Upstage เปิดตัว Solar Mini โมเดลภาษาขนาดใหญ่แบบกะทัดรัด ซึ่งใช้สถาปัตยกรรม Llama 2 จำนวน 32 เลเยอร์ และกำหนดค่าเริ่มต้นด้วยค่าน้ำหนักของ Mistral 7B บริษัทระบุว่าเทคนิคการขยายความลึกของตนผสานการขยายโมเดลตามแนวลึกเข้ากับการฝึกเบื้องต้นอย่างต่อเนื่อง Solar Mini เปิดให้บุคคลทั่วไปใช้งานภายใต้สัญญาอนุญาต Apache 2.0

อ่าน 5 นาที

Upstage เปิดตัว Solar Pro 4 สำหรับงานเอเจนต์แบบหลายขั้นตอน

Upstage launched Solar Pro 4, an API-accessible model designed for multi-step agent work involving documents, tools and terminal tasks. The company says it supports a 512K-token context window, produces up to 128K output tokens, handles English, Korean and Japanese, and reports when supplied evidence cannot support an answer.

อ่าน 6 นาที

แอนโทรปิกเผยวิธีที่ห้องปฏิบัติการวิจัยสร้างเอเจนต์วิทยาศาสตร์ที่ขับเคลื่อนด้วยโคลด

แอนโทรปิกเผยแพร่กรณีศึกษาเมื่อวันที่ 15 ม.ค. 2026 โดยอธิบายถึงห้องปฏิบัติการวิจัยสามแห่ง ได้แก่ โครงการไบออมนีของสแตนฟอร์ด ห้องปฏิบัติการชีสแมนของเอ็มไอที และห้องปฏิบัติการลุนด์เบิร์กของสแตนฟอร์ด ซึ่งสร้างระบบที่ขับเคลื่อนด้วยโคลดสำหรับงานต่าง ๆ เช่น การตีความกลุ่มยีน การวิเคราะห์ข้อมูลชีวการแพทย์ และการเลือกยีนที่จะนำไปศึกษาด้วยการทดลอง

อ่าน 8 นาที

ไฟน์จูน ใช้ระบบค้นคืนข้อมูล หรือปรับพรอมต์ให้ดีขึ้น: ควรเลือกอย่างไร

เริ่มจากวินิจฉัยความล้มเหลวก่อน หากโมเดลไม่รู้อะไรบางอย่าง นั่นคือช่องว่างด้านความรู้ ซึ่งแก้ได้ด้วยการค้นคืนข้อมูล หากโมเดลรู้แต่ตอบด้วยโครงสร้าง น้ำเสียง หรือรูปแบบที่ไม่ถูกต้อง นั่นคือช่องว่างด้านพฤติกรรม ซึ่งควรแก้ด้วยพรอมต์ก่อน แล้วจึงพิจารณาไฟน์จูน หากลองทั้งสองวิธีแล้วโมเดลยังทำทักษะเฉพาะทางไม่ได้ การไฟน์จูนคือทางเลือกที่เหลืออยู่ การใช้พรอมต์มีต้นทุนต่ำที่สุดและย้อนกลับได้ง่าย การค้นคืนข้อมูลเป็นตัวเลือกเริ่มต้นที่เหมาะสมสำหรับข้อเท็จจริง ส่วนการไฟน์จูนมีต้นทุนสูงที่สุดและย้อนกลับได้ยากที่สุดในสามวิธี

อ่าน 14 นาที

วิเคราะห์: บริบทยาวไม่ได้ฆ่าการค้นคืนข้อมูล — แต่เปลี่ยนหน้าที่ของมันต่างหาก

ไม่ใช่ แต่มันเปลี่ยนบทบาทของ RAG ไป การยัดข้อมูลจนเต็มหน้าต่างบริบทขนาดใหญ่จะทำให้ความแม่นยำลดลงสำหรับข้อมูลที่ฝังอยู่ตรงกลาง เพิ่มความหน่วงและต้นทุนในทุกคำขอ และทำให้ยากที่จะระบุว่าคำตอบมาจากแหล่งใด การค้นคืนข้อมูลยังคงเป็นทางเลือกที่เหมาะสมที่สุดสำหรับคลังข้อมูลขนาดใหญ่หรือที่เปลี่ยนแปลงอยู่เสมอ สำหรับงานใดก็ตามที่ต้องการการอ้างอิงแหล่งที่มาหรือการควบคุมสิทธิ์การเข้าถึง และสำหรับเส้นทางที่มีปริมาณการใช้งานสูงซึ่งอ่อนไหวต่อต้นทุน ส่วนบริบทยาวในปัจจุบันเหมาะที่จะนำไปใช้กับการให้เหตุผลจากเอกสารทั้งฉบับ ใช้เป็นหน่วยความจำทำงานของเอเจนต์ในแต่ละงาน และใช้เป็นขั้นตอนที่สองต่อจากการค้นคืนข้อมูลที่ได้คัดกรองขอบเขตให้แคบลงแล้ว

อ่าน 16 นาที

บทวิเคราะห์: เมื่อเกณฑ์มาตรฐานสาธารณะไม่อาจทำนายคุณภาพในการใช้งานจริงได้อีกต่อไป — วิธีสร้างชุดประเมินที่ทำได้

เกณฑ์มาตรฐานสาธารณะวัดงานที่มีขอบเขตแคบ ตายตัว และเผยแพร่อย่างแพร่หลาย อีกทั้งยังปนเปื้อนอยู่ในข้อมูลฝึกสอนมากขึ้นเรื่อย ๆ และถูกใช้เป็นเป้าหมายในการปรับโมเดลโดยตรง แต่คุณภาพในการใช้งานจริงขึ้นอยู่กับพรอมป์ของคุณ เอกสารของคุณ สคีมาของเครื่องมือ และระดับความผิดพลาดที่คุณยอมรับได้ ซึ่งไม่มีตารางจัดอันดับใดวัดได้ คำตอบที่ใช้ได้จริงคือชุดประเมินส่วนตัวที่ประกอบด้วยกรณีจริง 50 ถึง 300 กรณี พร้อมบันทึกพฤติกรรมที่คาดหวัง นำมาทดสอบทุกครั้งที่เปลี่ยนโมเดลหรือพรอมป์ โดยให้คะแนนด้วยการตรวจสอบแบบตรงตัวเมื่อทำได้ และใช้โมเดลผู้ตัดสินตามเกณฑ์การให้คะแนนเมื่อทำไม่ได้

อ่าน 15 นาที

Anthropic เผยแพร่รายงาน Economic Index ฉบับที่สอง ว่าด้วยการใช้งาน Claude 3.7 Sonnet

รายงาน Economic Index ฉบับที่สองของ Anthropic พบว่าการใช้งาน Claude.ai ในด้านการเขียนโค้ด การศึกษา วิทยาศาสตร์ และสาธารณสุข เพิ่มขึ้นหลังการเปิดตัว Claude 3.7 Sonnet โดยโหมดคิดแบบขยายความถูกใช้มากที่สุดในสายอาชีพด้านเทคนิค ขณะที่สัดส่วนการใช้งานแบบเสริมศักยภาพ (augmentation) ยังคงทรงตัวอยู่ที่ 57% และ Anthropic ยังเผยแพร่ระบบจัดหมวดหมู่การใช้งานใหม่ 630 หมวด พร้อมข้อมูลการทำงานอัตโนมัติในระดับงานย่อยด้วย

อ่าน 8 นาที

MiniMax เปิดตัว Speech 2.8 พร้อมแท็กเสียงและการโคลนเสียง

MiniMax เปิดตัว Speech 2.8 โมเดลเสียงสังเคราะห์ที่มีแท็กเสียงในตัวสำหรับการหายใจและการลังเล การโคลนเสียงจากตัวอย่างเสียง 10 วินาที และกระบวนการที่มุ่งลดสัญญาณรบกวนและความผิดเพี้ยน บริษัทยังระบุว่าได้ปรับปรุงการสังเคราะห์เสียงข้ามภาษาสำหรับภาษาจีนกลางและภาษาญี่ปุ่น และเปิดให้ใช้งานโมเดลนี้ผ่านแพลตฟอร์มและผลิตภัณฑ์ Audio ของบริษัท

อ่าน 6 นาที

DeepSeek เปิดตัวโมเดลมัลติโมดัล V4-Flash-Vision-Exp

DeepSeek เปิดตัว DeepSeek-V4-Flash-Vision-Exp ซึ่งเป็นโมเดลมัลติโมดัลเชิงทดลองบนแพลตฟอร์ม API ของบริษัท บริษัทระบุว่าโมเดลนี้มีประสิทธิภาพเทียบเท่า DeepSeek-V4-Flash ในงานด้านข้อความ พร้อมทั้งเพิ่มความสามารถด้านการมองเห็น (vision) เข้ามา และอ้างว่ามีการก้าวกระโดดครั้งสำคัญในผลการทดสอบมาตรฐาน (benchmark) ของเอเจนต์แบบมัลติโมดัล เมื่อเทียบกับ V4-Flash โดยใกล้เคียงกับ Opus-4.8 นอกจากนี้ DeepSeek ยังได้เปิดตัว Files API ฟรี และ DeepSeek Harness 0.1.1 อีกด้วย

อ่าน 3 นาที

RAG (retrieval-augmented generation) คืออะไร และเมื่อไหร่ที่คุณต้องการมัน?

การสร้างข้อมูลโดยการสืบค้น (Retrieval‑augmented generation) เป็นรูปแบบหนึ่งที่ระบบค้นหาเอกสารของคุณเองเพื่อหาบทที่เกี่ยวข้องกับคำถาม แล้วใส่บทเหล่านั้นเข้าไปใน Prompt ของโมเดลและขอให้โมเดลตอบโดยใช้ข้อมูลนั้น ระบบน้ำหนักของโมเดลไม่เคยเปลี่ยนแปลง; ความรู้จะมาถึงในรูปแบบของบริบทเมื่อใดก็ตามที่มีการเรียกใช้

อ่าน 8 นาที

บริบทหน้าต่างคืออะไร และทำไมมันถึงเต็ม?

ขนาดหน้าต่างบริบทคือปริมาณข้อความสูงสุดที่วัดเป็นโทเคน ที่โมเดลสามารถพิจารณาในคำขอหนึ่งเดียวได้ มันเก็บคำสั่งระบบ คำสนทนาไปแล้ว เอกสารที่คุณวางไว้ และคำตอบที่กำลังสร้าง เมื่อรวมทั้งหมดเกินขีดจำกัด จะต้องทิ้งหรือสรุปบางส่วน

อ่าน 8 นาที