Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
Bodee
@Bodee
Learner, Philanthropist, $BTC, Born in Chiang Mai, Made in Thailand. Meaning of life is written by your mind so write it good. Weniger, aber besser
Nonthaburi, Thailand
Joined April 2009
1K
Following
308
Followers
10.7K
Posts
Bodee
@Bodee
1 day ago
มันก็มีเด็กเหี้ยมาทุกยุคนั้นแหละครับ สำคัญคือ คนเอาเรื่องเหี้ยๆ ของคนไม่กี่คนมา สรุปว่าทั้งโคตรเจนนี้ นั้นมันมักง่ายทางการสรุปเหมารวมกันไปหน่อย สำหรับครูผมเข้าใจความรู้สึก และเข้าใจบริบทเด็กที่ใช้คำได้สถุล แต่บริบทความชิงชังที่ไม่แยกแยะ เอายอดไลก์เยอ��สมทบความคิด bias เพราะไม่ชอบเจนนั้น นี้เป็นทุนอยู่แล้วก็ไม่ต่างกันหรอก
See More
Bodee
retweeted
AIMeowYak (เอไอเหมียวยักษ์)
@aimeowyak
4 days ago
ปกติผมจะไม่เชื่อ Benchmark ของ Qwen เพราะ Benchmaxx แน่นอน แต่รอบนี้ต่างออกไป... Qwen 3.8 Max ถือว่าเป็นหนึ่งใน Frontier โมเดลจริงๆ สามารถสู้ Opus 4.8 Fable 5 ได้ตาม Benchmark เลย "มันสามารถจดจ่อกับเป้าหมายที่ยากและเปิดกว้างได้ต่อเนื่องหลายวัน คิดไอเดียของตัวเองขึ้นมา แล้วเปลี่ยนไอเดียเหล่านั้นให้กลายเป็นผลงานที่ใช้ได้จริง ทั้งหมดนี้โดยไม่มีมนุษย์อยู่ใน loop เลย" นี่คือประโยคที่ทีม Qwen ใช้สรุปความโดดเด่นของ Qwen3.8-Max ในบทความเปิดตัววันนี้ ประโยคสวยๆ แบบนี้ค่ายไหนก็เขียนได้ แต่สิ่งที่ทำให้ผมนั่งอ่านจนจบคือหลักฐานที่แนบมาด้วย มีทั้ง repo สาธารณะบน GitHub การลงแข่งจริงกับทีมมนุษย์ 526 ทีม ไปจนถึง layout ชิปที่ผ่านชุดเครื่องมือมาตรฐานของวงการ และที่สำคัญที่สุดคื��ประกาศว่าจะ open weights สัปดาห์หน้า ใครไม่เชื่อก็โหลดไปพิสูจน์เองได้เลย แต่ก่อนจะไปว่ากันเรื่องตัวโมเดล ขอแทรกเรื่องที่ผมเพิ่งค้นพบนิดหนึ่ง ยุคนี้โมเดลจีนผลัดกันออกแทบทุกสัปดาห์ ถ้าอยากตามให้ทันตลอดเวลา Qwen Token Plan ถือว่าคุ้มมาก เพราะใช้กับ open source model จีนได้เกือบทั้งหมด ผมลองคำนวณดูแล้ว ถ้ารู้ตัวว่าชอบค่ายไหนเป็นพิเศษ เช่น GLM 5.3 ที่กำลังจะออก สมัครตรงกับค่ายนั้นถูกกว่าครับ แต่ถ้ายังไม่แน่ใจ สมัครเบาๆ อย่าง lite plan เดือนละราว 5 ถึง 6 USD เอาไว้ลองหลายๆ ตัวก่อน ผมว่าคุ้ม กดจาก link นี้ได้เครดิตฟรีไปคนละ 4 USD ต่อให้สมัคร lite เล็กสุดแบบรายเดือน 6 USD ก็เอาไว้ทดสอบได้สบาย ที่บอกตอนนี้เพราะผมแทงว่า GLM 5.3 กับ DeepSeek v4 Pro ตัวเต็มกำลังจะออกมา รับกับ Gemini 3.5 Pro และ Grok 4.6 ที่คาดว่าจะมาในสัปดาห์นี้ถึงสัปดาห์หน้าเช่นกัน ═══════════════════ 📌 Qwen3.8-Max โดยสรุป โมเดลที่เก่งที่สุดของตระกูล Qwen ต่อยอดจากสถาปัตยกรรมของ Qwen3.5 ขนาด 2.4 trillion parameters โดย active จริงครั้งละ 95B เป็นครั้งแรกที่ Qwen เปิด weights ของโมเดลระดับ Max โดยจะปล่อยสัปดาห์หน้า ตอนนี้เรียกใช้ผ่าน API บน QwenCloud ได้ก่อน จุดขายคือไม่ใช่แค่ตอบคำถามที่ยากขึ้น แต่ทำงานซับซ้อนแบบ end-to-end ได้จนจบ และส่งมอบงานที่พึ่งพาได้จริง ═══════════════════ 💻 Coding: 3 เคสที่ปล่อยให้ทำเองล้วนๆ ไม่มีมนุษย์ช่วยเลย จุดร่วมของทั้ง 3 เคสคือโมเดลไม่ได้เดินตามแผนตายตัว แต่พัฒนาตัวเองผ่าน feedback loop เขียนโค้ดต่อเนื่อง 10+ วัน สร้างระบบที่อัปเกรดตัวเอง สร้างโปรเจกต์ oh-my-cli จากโฟลเดอร์เปล่า แล้วสร้าง harness ที่รวม feedback ของผู้ใช้ แนวปฏิบัติจาก community และผลทดสอบของตัวเอง เข้าเป็น loop วิศวกรรมเดียวกัน วงจรทำงานคือ ความต้องการใหม่เข้า GitHub Issues แล้ว agent รับงานผ่าน state machine (ready → leased → active) ทำเสร็จก็รัน E2E test กับ CI ผ่านแล้วจึง merge PR ทุกครั้งที่ update จะทดสอบตัวเอง (Build, Unit Test, E2E, Desktop Lifecycle) เจอความผิดปกติก็ส่งกลับไปที่ issue หรือ PR เพื่อแก้และตรวจซ้ำ ระหว่างทางยังงอกความสามารถใหม่ให้ตัวโปรแกรมต่อเนื่อง เช่น /goal, /resume, Dynamic Workflow, Session Replay และ Desktop ผ่านไปราว 16 วันของการทำงานอัตโนมัติล้วนๆ ได้ 265 commits, 127 PRs และ 151 issues โดย trace ทั้งหมดเปิดสาธารณะที่ repo qwen-code-dev-bot/oh-my-cli ทำซ้ำงานวิจัย แล้วทำให้ดีกว่าต้นฉบับ โจทย์คือได้ paper เรื่อง Unified Data Selection for LLM Reasoning กับ GPU มา 1 ชุด ไม่มีโค้ดตั้งต้นใดๆ ให้ reproduce การทดลองเป็นโค้ด แล้วลองทำให้ดีกว่าเดิม ทำงานเองต่อเนื่องราว 5 วัน (125 ชั่วโมง) เขียนโค้ดราว 7,600 บรรทัด กว่า 1,100 actions และเทรนบน GPU 33 รอบ 37 ชั่วโมงแรกใช้สร้าง pipeline ทั้งหมดขึ้นจากศูนย์ แล้วทำซ้ำข้อค้นพบหลักทั้ง 6 ข้อของ paper สำเร็จ ด้วยการ fine-tune โมเดล Qwen3-8B บนข้อมูลที่คัดเลือกมาแล้ววัดผลซ้ำๆ เช่น ยืนยันว่าวิธีคัดข้อมูลของ paper ชนะการสุ่มเลือกอยู่ +7.7% บนข้อสอบคณิตศาสตร์ระดับแข่งขัน AIME24 อีกราว 88 ชั่วโมงที่เหลือ เข้าสู่ loop วิจัยของตัวเอง ตั้งสมมติฐาน → เขียนโค้ด → รันบน GPU → วิเคราะห์ → ลองใหม่ รวมแล้วคิดและทดสอบไอเดียของตัวเอง 18 ไอเดียใน 4 รอบ จบด้วยวิธีใหม่ที่ชนะวิธีของ paper เองอีก +2.7 คะแนนบน AIME24 ลงแข่งจริง ชนะทีมมนุษย์ 87% ของสนาม ภายใน 24 ชั่วโมง สนามจริงคือ WWW2025 Multimodal Dialogue Intent Recognition Challenge บนแพลตฟอร์ม Tianchi ของ Alibaba Cloud ที่มีทีมมนุษย์แข่งอยู่ 526 ทีม โจทย์คืออ่านแชทบริการลูกค้า ทั้งข้อความและ screenshot สินค้า แล้วตีความให้ถูกว่าลูกค้าต้องการอะไร ฝั่งข้อความ fine-tune แล้ว ensemble โมเดลภาษาจีนหลายตัว (BERT, MacBERT, RoBERTa) ฝั่งภาพ fine-tune Qwen2.5-VL-7B โดยมี Chinese-CLIP ช่วยโหวตภาพที่โมเดลหลักไม่มั่นใจ รวมทั้งหมดเป็นระบบโหวตแบบถ่วงน้ำหนัก แล้วปรับน้ำหนักเสียงของแต่ละโมเดลด้วย cross-validation ส่งคำตอบ 45 ครั้ง เอา feedback แต่ละรอบมาปรับการ fine-tune และน้ำหนักในรอบถัดไป ความแม่นยำไต่จาก 0.60 ไปจบที่ 0.853 ชนะ 458 จาก 526 ทีม ════════���══════════ 💼 งานอาชีพจริง: stress test กับงานหลายร้อยอาชีพ เบื้องหลังคือการ scale ระบบ RL ในสภาพแวดล้อมทำงานจริงหลายแกนพร้อมกัน ทั้งความยาวของงาน (งานเดี่ยว → หลายงาน → งานข้ามหลายวัน) ความซับซ้อนของพื้นที่ทำงาน และความหลากหลายของ harness บวกกับ Universal Reward System ที่รวมการตรวจงานหลายรูปแบบ ทั้งรันโค้ดตรวจจริง ���ห้คะแนนตาม rubric และตรวจแบบ agent ไว้ในระบบเดียว ผลคือความสามารถยกขึ้นพร้อมกันในหลาย harness ไม่ว่าจะเป็น QwenWork, Claude Code, Codex, OpenClaw หรือ Hermes ตัวอย่างงานที่โชว์: ที่ปรึกษากฎหมายด้าน compliance: กวาดตรวจเอกสารหลายร้อยฉบับ พบ 1,284 ข้อสัญญาที่เกี่ยวข้องในรอบเดียว จบภายในไม่ถึง 1 ชั่วโมง งานระดับนี้ปกติทีม paralegal ช่วยกันทำราว 1 สัปดาห์ UI/UX designer: ต้นแบบ interactive ของแอปธนาคารดิจิทัล NOVA จำนวน 8 หน้าจอ design system สอดคล้องกันทั้งชุด เสร็จในรอบเดียวไม่ต้องแก้ จากปกติที่วนแก้กัน 3 ถึง 5 รอบ เจ้าของแบรนด์ร้านอาหาร: อ่านเอกสารวัตถุดิบกว่า 100 ฉบับ แล้วออกเมนูครบชุด 26 จานในรอบเดียว ทุกจานมีแคลอรี่เฉลี่ยและแหล่งที่มาวัตถุดิบกำกับ คุมสัดส่วนต้นทุนอาหารที่ 33.8% งานที่ปกติหัวหน้าเชฟและทีมต้องลองสูตร คิด���้นทุน วนแก้กันหลายสัปดาห์ วิศวกรโครงสร้าง: จากแบบก่อสร้างชุดเดียว สร้างแบบจำลองโครงสร้างต้านแผ่นดินไหวของอาคารสำนักงาน 30 ชั้นขึ้นในเบราว์เซอร์ เอาเมาส์ชี้ดู natural period, base shear และ inter-story drift ratio ได้ทันที ปกติวิศวกรต้องสร้างเองในซอฟต์แวร์เฉพาะทาง ใช้เวลากว่า 1 สัปดาห์ นักบำบัดฟื้นฟู: เปลี่ยนแบบประเมินกระดาษ 2D เป็น demo 3D แบบ interactive หมุนดูได้ทุกมุม ซ้อนชั้นกายวิภาคทีละชั้น ให้คนไข้เห็นชัดว่าจุดบาดเจ็บอยู่ตรงไหนและการฟื้นตัวคืบหน้าแค่ไหน งานที่เคยต้องจ้างสตูดิโอ medical animation รอ 2 ถึง 4 สัปดาห์ จ่ายหลายพัน USD นักวิเคราะห์ข้อมูลกีฬา: ย่อยข้อมูลราว 8,400 possession ทั้งเกมรุกเกมรับต่อผู้เล่น 1 คน ออกมาเป็นโปรไฟล์แทคติกและรายงานสำหรับโค้ชในหลักสิบนาที จากที่ทีมวิเคราะห์ปกติใช้เวลาหลายวันทำงาน 📈 เคสที่ลึกสุดคือสายการเงิน: งานวิจัย quant จบในบทสนทนาเดียว จากคำสั่งบรรทัดเดียว โมเดลวางแผน workflow เองแล้วทำงานต่อเนื่องหลายชั่วโมง ส่งมอบกลยุทธ์ ETF-rotation ครบวงจร ตั้งแต่วางระบบข้อมูล สร้าง factor พื้นฐาน ไปจนถึงวน backtest ปรับปรุงหลายรอบ ตัดสินใจจากหลักฐานระหว่างทาง ไม่ใช่ script ตายตัว เช่น เจอสัญญาณ overfitting (ผลช่วงออกแบบกับช่วงตรวจสอบไม่ตรงกัน) ก็ตัด factor ส่วนเกินทิ้งเองทีละรอบ เห็นหลายเส้นทางลู่เข้าหาสัญญาณชุดเดียวกันก็เพิ่มการตรวจแบบ multi-seed เพื่อกันการยึดติดเส้นทาง และเปลี่ยนกรอบกลยุทธ์เองเมื่อประเมินว่าการ ensemble 3 โมเดลไม่ทนทานพอ ฝั่งความกว้าง จากคำอธิบายสั้นๆ ของ 6 ตระกูล factor คลาสสิก (momentum, value, quality, investment, low-risk, sentiment) แตกเป็นตระกูลละ 50 ทิศทางวิจัย กระ��ายงานให้ sub-agent ราว 330 ตัว รวม backtest ราว 6,000 ครั้ง factor ที่คัดได้มี excess Sharpe ratio 0.64 ถึง 1.48 และค่า IC เป็นบวกทั้งหมดที่ 0.010 ถึง 0.014 งานสเกลนี้ปกติกินเวลานักวิจัย quant หลายสัปดาห์ถึงหลายเดือนแบบทำทีละขั้น ═══════════════════ ⚙️ งานยาวสุดโหด เคสแรก: ออกแบบชิปเองครบทั้ง flow โจทย์คือ hardware accelerator สำหรับการเข้ารหัส GCD / RSA (รวม modular exponentiation และ modular multiplication) ต้องถูกต้องแบบ bit-exact ที่ 4, 6, 8 และ 16-bit พร้อมกดจำนวน gate หลัง synthesis ให��ต่ำที่สุด เริ่มจากคำอธิบายงาน RTL template เปล่าๆ และ script ตรวจคะแนนเท่านั้น ไม่มีแบบเฉลย ไม่มีมนุษย์แทรกแซง ทำใน sandbox ที่ต่อกับชุดเครื่องมือจริงของวงการ ทั้ง Iverilog (จำลองการทำงาน), Yosys (สังเคราะห์วงจร) และ OpenROAD (วาง layout กายภาพ) รันรวดเดียวราว 500 turns ประเมินผล 71 ครั้ง ผ่าน milestone สำคัญ 13 จุด ดีไซน์แรกที่ทำงานถูกต้องใช้ 8,298 gates แล้วไล่รื้อจนเหลือ 678 gates นำทุกโมเดลที่ถูกทดสอบ ก้าวใหญ่สุดคือกล้ารื้อระดับ algorithm ตั้งแต่ turn 22 เปลี่ยน hardware modulo divider ที่กินพื้นที่มาก เป็นสถาปัตยกรรม iterative shift-subtract ลดทีเดียว 6,288 gates หรือกว่า 80% ของที่ลดได้ทั้งหมด ที่น่าทึ่งคือยังหาทาง breakthrough ต่อได้แม้เลยไปหลายร้อย turn โดย milestone สุดท้ายเกิดช่วง turn 443 ถึง 500 ไม่ใช่เก็บของง่ายช่วงต้นแล���วนิ่งไปเลย ยืนยันถึงระดับกายภาพ พื้นที่ชิปลดจาก 106×106 µm² เหลือ 46×46 µm² หรือลดลง 81% ความยาวสายเชื่อมต่อจาก 33,369 µm เหลือ 4,187 µm และผ่านเป้าความเร็ว 500 MHz สำเร็จ จากเดิมที่พลาดเป้า timing อยู่ 4.46 ns กลายเป็นเหลือเผื่อ 0.66 ns 🛒 เคสที่สอง: บริหารร้านค้า online จำลองยาว 365 วัน E-Commerce Bench สร้างจาก��้อมูลธุรกรรมจริงที่ปกปิดตัวตนแล้วของ Taobao และ Tmall จำลองระบบนิเวศครบ ทั้งร้าน 12 ประเภท สินค้า 60 หมวดรวม 7,000 รายการ และซัพพลายเออร์เกือบ 600 ราย เริ่มด้วยทุน 100,000 หยวน ต้องตัดสินใจเองครบสายตลอดปี ทั้งเลือกสินค้า เจรจาซัพพลายเออร์ บริหารสต็อก ตั้งราคาแบบ dynamic และจัดการของตีคืน ภายใต้แรงกดดันกระแสเงินสดจากระบบชำระเงินที่สมจริง ซัพพลายเออร์แต่ละรายถูกออกแบบด้วยหลัก game theory มี��ิสัยและกลยุทธ์ยอมถอยต่างกัน ต้องเจรจากันหลายรอบด้วยภาษาธรรมชาติ Qwen3.8-Max โชว์การเรียนรู้สะสม เจรจาสินค้าเดิมกับเจ้าเดิมซ้ำๆ แล้วกดราคารับซื้อลงได้เรื่อยๆ กำไรขยับขึ้นรอบต่อรอบ แถมเอาประสบการณ์ไปใช้ต่อกับสินค้าใกล้เคียงได้ ขณะที่โมเดลอื่นส่วนใหญ่ตันตั้งแต่กลางเกม ในระบบยังซ่อนผู้ขายโกงไว้ 152 ราย ทั้งกับดักค่าสมาชิก ของถูกล่อซื้อ และของไม่ตรงปก บวกเหตุแทรกซ้อนอย่างพายุไต้ฝุ่นและวัตถุดิบขาดช่วงมหกรรมลดราคา เพื่อทดสอบการบริหารความเสี่ยงและจังหวะการตุนของ โมเดลวางแผนล่วงหน้าได้ดี ลงทุนหนักสุดตั้งแต่ช่วงแรกเพื่อยึดตำแหน่ง แล้วช่วงมหกรรมลดราคาปลายปีทำกำไรสุทธิเกิน 100,000 หยวน เกือบ 2.4 เท่าของอันดับ 2 อย่าง GLM 5.2 ปิดปีด้วยยอดเงินรวม 416,252 หยวน หรือผลตอบแทน 4.16 เท่า ชนะ GLM 5.2 อยู่ 38% และดี���ว่ารุ่นก่อน Qwen3.7-Max ถึง 152% ผ่านการโต้ตอบมากกว่า 2,000 รอบ ═══════════════════ 👁️ Multimodal: จากเข้าใจภาพ ไปสู่ทำงานด้วยภาพ ฝั่งเอกสาร อ่านรายงานการเงินหรือ PDF ซับซ้อนเกิน 200 หน้า เข้าใจทั้งข้อความ chart และ layout ข้ามหน้า แล้วสกัดประเด็นสำคัญออกมาเป็นรายงานมีโครงสร้างหรือหน้าเว็บพร้อมใช้งาน ฝั่ง video ประมวลผลได้ยาวเกิน 100 ชั่วโมง สร้างเป็น video memory graph เชื่อมโยงคน เหตุการณ์ เวลา และฉากเข้า���้วยกัน ใช้ย้อนดูลำดับเหตุการณ์ ความสัมพันธ์ตัวละคร และช่วงเวลาสำคัญได้ ไม่ว่าจะเป็นซีรีส์ทั้งเรื่องหรือ livestream ยาว 100 ชั่วโมง งานสร้างจริงก็ทำได้ ตั้งแต่ตัด footage ส่วนตัวเป็น vlog เปลี่ยนคำถามให้เป็น animation เพื่อการศึกษา สร้างโปรเจกต์ frontend ทั้งโปรเจกต์จาก screenshot หน้าจอเดียว เปลี่ยนแปลนบ้านเป็นงาน 3D ใน Blender ไปจนถึงพัฒนาเกมและแอป interactive จากคำสั่งภาษาธรรมชาติ จุดเปลี่ยนสำคัญคือกา��มองเห็นไม่ได้จบแค่ขา input ระหว่างทำงานโมเดลจะคอยสังเกตผลงานตัวเอง เช่น เห็นว่าโทรทัศน์ในฉากหันผิดทิศ หรือ interface วางเพี้ยน ก็ระบุจุดผิด ปรับแผน แล้วแก้งานเองอัตโนมัติ กลายเป็น feedback loop ทางสายตาครบวงจร ทั้งวางแผน ลงมือ ตรวจ และวนแก้ Hybrid Agent คือการจับคู่การเขียนโค้ด (ทำงานหนักได้เร็วและ scale ได้) กับการควบคุมหน้าจอแบบ GUI (เข้าถึงทุกอย่างที่มนุษย์เห็นและกดได้ พร้อมรับ feedback จากระบบที่รัน��ยู่จริง) วัดด้วย benchmark ใหม่ชื่อ RecreationBench ให้โมเดลดูแอปจริงที่รันอยู่แบบ black box ไม่มี source code ไม่มี internet แล้วสร้างแอปทั้งตัวขึ้นใหม่จากศูนย์ ครอบคลุม 5 แพลตฟอร์มทั้ง Ubuntu, macOS, Windows, Android และ web แถมปล่อย Qwen-MM-Plugins ไลบรารีส่วนขยายสำหรับ harness ของ agent ที่มีอยู่แล้ว เติมทั้งการประมวลผลภาพและ video, multimodal memory, dynamic-resolution, การใช้เครื่องมือทางภาพ ไปจนถึงงานเฉพาะทางอย่างตัดต่อ video, Blender และ CAD ═══════════════════ 📊 ตัวเลข benchmark: ที่ชนะก็มี ที่แพ้เขาก็ใส่มาตรงๆ ฝั่งที่ทำได้ดี เทียบกับ Claude Opus 4.8, Claude Fable 5 และ GPT-5.6 Sol: PaperBench (ทำซ้ำงานวิจัย): 93.0 สูงสุดในตาราง เหนือ GPT-5.6 Sol (90.5) และ Fable 5 (88.8) Terminal Bench 2.1: 86.6 แซงทั้ง Opus 4.8 และ Fable 5 (84.6 เท่ากัน) เป็นรองเพียง GPT-5.6 Sol (88.8) OSWorld-Verified (agent ใช้คอมพิวเตอร์): 86.1 สูงสุด เหนือ Fable 5 (85.0) IFBench (ความแม่นยำในการทำตามคำสั่ง): 82.8 สูงสุดในตาราง HealthBench: 60.2 เหนือ GPT-5.6 Sol (55.3) และ Opus 4.8 (52.4) ส่วน Fable 5 ไม่มีคะแนนรายงาน อันนี้สาย healthcare น่าจับตา PLawBench (กฎหมาย): 73.2 และ PRBench-Finance: 58.3 สูงสุดทั้งคู่ ฝั่งภาพแรงเป็นพิเศษ เช่น MathVision 95.2, LogicVista 91.9, SLAKE ซึ่งเป็น VQA การแพทย์ 90.8 และ Parametric CAD Bench 91.5 ฝั่งที่ยังตามอยู่: SWE-bench Pro: 67.7 ยังห่างจาก Fable 5 (80.0) ชัดเจน FrontierSWE: 73.5 เทียบกับ Fable 5 ที่ 88.8 DeepSWE 1.1: 56.6 ตามหลังทั้ง GPT-5.6 Sol (73.0) และ Fable 5 (70.0) HLE: 43.6 ต่ำกว่า Fable 5 (53.3) และ GPT-5.6 Sol (47.2) MobileWorld: 77.8 เทียบกับ Fable 5 ที่ 85.5 เกร็ดที่ผมชอบคือ benchmark ฝั่ง coding จำนวนมาก ทีม Qwen รันผ่าน harness ของ Claude Code แล้วแนบเงื่อนไขทดสอบละเอียด ทั้ง timeout ขนาด context และจำนวนรอบเฉลี่ย เปิดให้คนอื่นตามตรวจวิธีวัดได้ ═══════════════════ 🎯 ทำไมผมถึงบอกว่ารอบนี้ต่างออกไป หลักฐานเป็นกระบวนการที่เปิดให้ตรวจ ไม่ใช่แค่ตารางตัวเลข ทั้ง repo สาธารณะ qwen-code-dev-bot/oh-my-cli การลงแข่งจริงกับมนุษย์ 526 ทีมบนแพลตฟอร์มกลาง และ layout ชิปที่ผ่านชุดเครื่องมือมาตรฐานของวงการ ตารางผลทดสอบใส่จุดที่ตัวเองยังแพ้มาด้วยตรงๆ โดยเฉพาะสายวิศวกรรมซอฟต์แวร์ที่ยังตาม Claude Fable 5 อยู่พอสมควร จะเปิด weights ในสัปดาห์หน้า เป็นครั้งแรกของโมเดลระดับ Max ใครไม่เชื่อ benchmark ก็โหลดไปทดสอบกับงานของตัวเองได้เลย สำหรับผม นี่คือสัญญาณว่าสนามแข่งของโมเดลหัวแถวขยับจากการตอบคำถามเก่ง ไปสู่การทำงานยาวหลายวันให้จบเองได้อย่างพึ่งพาได้ และ open source model กำลังไล่ขึ้นมาในสนามนี้เร็วกว่าที่หลายคนคิด
See More
Bodee
@Bodee
5 days ago
@MandeepRajBhar9
It’s an AI content. Look at the shadow and movement so easy.
Bodee
@Bodee
5 days ago
@brandnewnox
นนทบุรีถือว่าเป็นตจว. มั้นนะ 😅
Who to follow
Henry SSALI®
@HenrySsali
PhD(s) | Political Economist | Philanthropist | Educational Policy Analyst | University of Toronto Alum | Born at the Equator, Thriving at the North Pole | #IFB
Chogo
@Chogo
Snapterz
@Snapterz
Life, Apple, Sony Alpha, Technology, Camera, Computer, Mobile & Gadget.
Bodee
@Bodee
5 days ago
@KanidthaO
กิน ผมว่าใช้กับน้ำกัน���ิดมาตลอด กินคือกับของเหลวไม่ถูก แล้วประเทศเรามีคำว่า ดื่ม ไปทำไม ลบๆ ไปดีกว่าใช้ กินมันให้หมดดีมั้ย?
Bodee
@Bodee
6 days ago
@prayutnahee55
@priwziest
ขอตีความคำว่า ”นำเงินกลับไทย“ หมายถึง ขาย หุ้นตัวที่เคยซื้อ และเมื่อขายเงินจะแสดงบัญชีของฉัน เป็นบาท อย่างนี้เรียกว่า กลับไทยเลยใช่มั่ยครับ จริงๆ หากขายแล้วนำไปซื้อต่อเลย คล้ายๆ ปรับ port อย่างนี้ก็เข้าข่ายกลับไทย ทั้งๆ ที่ยังไม่มีเงินถอนออกจริงใช่มั้ยครับ
See More
Bodee
@Bodee
6 days ago
@LilyTheGistGuru
นักโทษชั้นดี คนที่มีส่วนร่วมกับการปล่อยให้มันออกมาซ้ำซากน่าจะได้สิทธิ์พิเศษรับไปทำงานที่บ้านกับคนที่รักดูสักหน มันสะท้อนความเละเทะของระบบ และคนที่ดูแล อย่างพูดภาษาบ้านๆ ได้ว่า พวกสันขวานทรงเกียรติ
Bodee
@Bodee
8 days ago
@poppy_rjk
ขอรหัสเอทีเอ็มมันแลกกัน
Bodee
@Bodee
8 days ago
@brandnewnox
ภาษาแบบนี้ เล่าได้ราวกับตัวหนังสือใน fiction ดีๆ สละสรวย ละเมียดละไม ใส่ใจในรายละเอียดไม่��พ้พี่คนที่ดื่มกาแฟนั้นเลยนะครับ 😅
Bodee
retweeted
JRT—Platinum Emperor Reserve Ceremonial Grade
@JRTDesk
8 days ago
จาก 197,000 เหลือ 39,000 ใน 2 เดือน เท่ากับขาดทุนประมาณ 80.2% การจะกลับไปที่จุดเดิมต้องกำไรประมาณ 405.12% แต่เพราะน้องอายุ 19.. ถือว่าโชคดีอยู่ครับ เพราะนี่อาจเป็นบทเรียนจากการขาดทุนที่ดีที่สุดที่เคยเสียในชีวิต… ถ้าได้เรียนรู้จากมัน แต่ถ้าจะถามว่า..「ทำยังไงดี?」 ไม่ควรไปหาหุ้น 5 เด้ง.. 10 เด้ง.. หรือใช้ leverage มากขึ้น.. ควรหยุดก่อน แล้วทำ autopsy ครับ…. 🍆 Strategy ของน้องมี edge จริง? หรือแค่ work ตอนตลาดขึ้น? 🍆 ตอนซื้อรู้ maximum loss มั๊ย?? 🍆 Position sizing ใช้อะไรคำนวณ? 🍆 Stop loss อยู่ตรงไหน? 🍆 วัด expectancy หรือยัง? 🍆 มี trading journal ไหม? 🍆 เคย backtest หรือ walk-forward test หรือเปล่า? 🍆 รู้มั๊ยว่าแพ้เพราะ variance หรือเพราะระบบไม่มี edge ตั้งแต่แรก? มืออาชีพจริงๆ จะไม่มีการเริ่มถามว่า..「จะเอา 39,000 กลับไปเป็น 197,000 ยังไง」 แต่เริ่มจาก..「ทำไมระบบถึงยอมให้เสีย 80% แต่แรก??」ถ้าระบบยอมให้เสีย 80% ครั้งนึง.. มันก็ยอมให้เสีย 80% อีกครั้งได้.. และต่อให้โชคดีเด้งกลับไปถึง 197,000 จริง.. ก็จะเสียมันไปอีกเพราะต้นเหตุไม่ได้ถูกแก้ไข เงิน 158,000 ที่ขาดทุนเป็นต้นทุนที่แพ��ก็จริง แต่ต้นทุนที่แพงที่สุดคือถ้าน้องสรุปบทเรียนผิด.. เช่นคิดว่า… 💦 ขาดทุนเพราะขายเร็วไป 💦 ครั้งหน้าต้อง all-in กว่านี้ 💦 ต้องใช้ margin 💦 ต้องเฉลี่ยลง 💦 ต้องหาหุ้นที่แรงกว่าเดิม เพราะปัญหาอาจไม่ได้อยู่ที่หุ้นตัวนั้น แต่อยู่ที่ระบบที่ยอมให้หุ้นตัวเดียว.. หรือการตัดสินใจไม่กี่ครั้งทำลาย portfolio ได้ถึง 80%.. จำไว้ว่าอย่าพยายามหาวิธีรวยเร็วที่สุด ต้องออกแบบระบบที่ทำให้���ยู่รอดได้นานที่สุด เพราะถ้ายังอยู่ในตลาด โอ��าสสร้างผลตอบแทนยังมีอยู่เรื่อยๆ.. แต่ถ้าคุณออกจากตลาดเพราะเจอ drawdown หนักเกินไป ต่อให้มี edge สูงแค่ไหนก็ไม่มีโอกาสได้ใช้มันอีก.. ⚠️ Note ⚠️ ตอนช่วงอายุ 18-19 ผมก็สร้าง portfolio แบบโตมาก~ จากอะไรที่คนภายนอกมองว่าเสี่ยงมากนะครับ 😅 day-trading.. จับ low float ผันผวนสูง.. เล่น top gainers top losers รายวัน.. short sell.. ใช้ margin 2x-4x.. แต่ไม่เจ๊ง กลับโตขึ้นเรื่อยๆ ฟังดูเหมือนรับความเสี่ยงสูง.. แต่จริงๆ risk ต่อ portfolio ในแต่ละ trade ถูกจำก���ดไว้ตั้งแต่ก่อนกดส่ง orders แล้ว.. สิ่งที่ทำให้ portfolio โต ไม่ใช่ leverage.. ไม่ใช่การ take risks.. แต่เพราะมี risk management ที่เข้มงวดจนไม่มี trade ไหนทำให้เสียหายถาวร.. ผลตอบแทนส่วนใหญ่ไม่ได้มาจากการชนะครั้งใหญ่แบบพลิกชีวิต.. แต่มาจากการไม่ยอมให้การขาดทุนครั้งเดียวทำลาย portfolio
See More
Bodee
@Bodee
9 days ago
@maidperdu
@satyanadella
Fair enough.
Bodee
@Bodee
9 days ago
@Gooboberti
@eurofounder
Opened with advanced & powerful AI but use the style of primitive PR. For real?
Bodee
@Bodee
10 days ago
@RonallChersan
นอกเรื่องนิสทุกคน แต่สำคัญ ขอฝากการโหวตทบทวน���ครงกา
ร #AIPA
SS กัน ลิงค์ลงทะเบียน: https://t.co/vFuc3vFNdm โพสต์อ้างอิง: https://t.co/YnbdRdYVs0…
Bodee
retweeted
เรือบิน ธรรม์ธีร์
@thuntee
10 days ago
ร่วมลงชื่อทบทวนโครงการ
#AIPass
ส่งให้
#กระทรวงดีอี
ใช้เวลาไม่ถึง 10 วินาที ที่ลิงค์นี้ครับ เหตุผลหลักของผมคือโครงการนี้เสียตังค์เป็นพันล้าน แต่กลับได้ระบบ
#ห่วยกว่าของฟรี
(ขออนุญาตใช้คำนี้เพราะสั้น-เข้าใจง่าย ผู้เกี่ยวข้องอย่าเคืองกัน��ะครับ 🙏) และยัง
#ผิดTO
R ข้อ 2.2 ที่กำหนดไว้เองว่าต้อง #เก็บและประมวลผลข้อมูลในประเทศ (ทั้งที่แค่ทำตามข้อนี้ ประเทศก็พลิกมาได้ประโยชน์เพิ่มง่ายๆ แล้ว แต่ก็ไม่เข้าใจว่าทำไมไม่ยอมทำ 😢) . #THAIPassport #AIPassport #GovTech
See More
Bodee
@Bodee
11 days ago
มันคือ นิสัยและกาลเทศะของการ��ิน Fast food บนโลกนี้ คือกินเสร็จ เก็บเอง ปฏิบัติตามหลักการ Clean As You Go เหมือนขี้เสร็จแล้วถามว่าต้องเช็ดก้นมั้ยนั่นแหละ ไม่รู้ว่าเดี๋ยวนี้ในโรงเรียนเค้าไม่สอน นิสัย ระเบีบบ กิน เก็บกันแล้วหรือไง ถึงมีผู้ใหญ่แบบนี้ออกมาถามคำถามแบบนี้ ควรหาความรู้ บรรทัดฐานทางสังคมและมารยาทพื้นฐาน (Social Norm & Etiquette) กันให้มากๆ
See More
Bodee
retweeted
Alice in Cryptoland 🧭
@CryptoAliceTH
12 days ago
หลายคนอาจกำลังแชร์ข้อมูลลับของตัวเองลง Google โดยไม่รู้ตัวค่ะ 😲 อลิซเจอโพสต์ไวรัลซึ่งมีประเด็นที่น่าสนใจเกี่ยวกับ
#Anthropic
และ Claude AI ส่งข้อมูลให้เพื่อ���ๆอ่านต่อเลยนะคะ 😊 เคสนี้ไม่ใช่การถูกแฮ็กค่ะ และไม่ใช่ข้อมูลหลุดจากเซิร์ฟเวอร์ แต่เป็น "ฟีเจอร์ Share" ที่หลายคนใช้ กลับทำให้ข้อมูลถูก Search Engine จัดทำดัชนี (Index) จนสามารถค้นหาเจอผ่าน Google และ Scraper ต่างๆ ได้ 😨 สาเหตุไม่ได้เกิดจากการเจาะระบบนะคะ แต่เกิดจากหน้าเว็บที่ Claude สร้างขึ้นเมื่อผู้ใช้กด Share หรือ Publish ถูกเปิดเป็นหน้าเว็บสาธารณะ (Public URL) และไม่มีการตั้งค่า noindex ซึ่งเป็นคำสั่งมาตร��านที่บอก Search Engine ว่า "ไม่ต้องนำหน้านี้ไปแสดงในผลการค้นหา" เมื่อผู้ใช้โพสต์ลิงก์เหล่านี้ลง Reddit, X, Discord หรือ GitHub Search Engine ก็สามารถค้นพบและนำไปจัดทำดัชนีได้เหมือนเว็บไซต์ทั่วไป ผลที่ตามมาคือ มีรายงานว่าพบข้อมูลจำนวนมากถูกค้นหาเจอ ไม่ว่าจะเป็น • API Keys และ Credentials • Crypto Wallet Information • Resume ที่มีชื่อ ที่อยู่ และเบอร์โทรศัพท์จริง • เอกสารภายในบริษัท • Dashboard และแผนงานลูกค้า • Financial Models และ Cap Tables • ร���มถึง Clinical Trial Summary ที่มีข้อมูลทางการแพทย์ 😳 ประเด็นสำคัญคือ นี่ไม่ใช่การรั่วไหลของ Chat ส่วนตัวค่ะ เฉพาะ Chat หรือ Artifact ที่ผู้ใช้ "เลือกกด Share หรือ Publish เอง" เท่านั้นที่ได้รับผลกระทบ แต่ปัญหาคือ คนส่วนใหญ่ตีความคำว่า "Anyone with the link" ว่าเป็นเพียง���ารแชร์ให้คนที่มีลิงก์ดูได้ ไม่ใช่การเผยแพร่ในลักษณะที่อาจถูก Google หรือเว็บไซต์อื่นๆ จัดเก็บและค้นหาเจอได้ ถ้าเพื่อนๆเคยใช้ฟีเจอร์ Share ของ #Claude แนะนำให้เช็คทันทีนะคะ Settings → Privacy → Your data → Shared chats → Manage จากนั้นตรวจสอบรายการที่เคยแชร์ และลบ (Delete) หรือยกเลิกการแชร์ (Unshare) หากมีข้อมูลที่ไม่ต้องการเปิดเผยต่อสาธารณะ รวมถึงตรวจสอบ Published Artifacts และเปลี่ยนกลับเป็น Only me หรือ Unpublish หากเอกสารนั้นไม่ควรถูกเข้าถึงจากภายนอก แม้ Anthropic และ Google จะเริ่มนำผลการค้นหาบางส่วนออกแล้ว แต่ข้อมูลที่เคยถูก Index หรือถูกเว็บไซต์อื่น Scrape ไป อาจยังคงหลงเหลืออยู่ได้อีกระยะหนึ่ง นี่สะท้อนประเด็นที่ใหญ่กว่าตัว Claude ในยุค AI เครื่องมือจำนวนมากกำลังทำให้ "การเผยแพร่ข้อมูล" ง่ายขึ้นกว่าที่เคย แต่ความหมายของคำว่า Public, Share และ Anyone with the link อาจไม่ตรงกับความ���ข้าใจของผู้ใช้งาน ลิงก์ที่คิดว่าแชร์เฉพาะเพื่อน อาจกลายเป็นหน้าเว็บที่ Search Engine มองว่าเป็น "เว็บไซต์สาธารณะ" และเมื่อข้อมูลถูก Index หรือถูก Scrape ไปแล้ว การลบต้นฉบับก็ไม่ได้หมายความว่าข้อมูลจะหายไปจากอินเทอร์เน็ตทันทีค่ะ 👀 ยุค AI เนี่ย ควรคิดให้รอบคอบทุกครั้งก่อนกด "Share" นะคะ เพราะบนอินเทอร์เน็ต "แชร์" อาจหมายถึง "เผยแพร่" มากกว่าที่เราคิดค่ะ 🚨 #AI #investing #techstocks
See More
Bodee
@Bodee
12 days ago
@cattodata
@woraperth
🙋♂️ปายยด้วย
Bodee
@Bodee
12 days ago
ฝากบอกทีมทำ vid ว่า คำสะกด “อนุญาต” เค้าสะกดผิด เกือบจะครบ จบแต่สะดุด ตรงนี้ ถ้าเป็นเมื่อก่อน คงผ่านตา copywriter และแก้ให้แล้ว หรือถ้าภาษาไทยแข็งแรงอยู่แล้วก็จะสะกดถูก หลังๆ ทักษะน้องๆ เก่งทุกทางยกเว้นเรื่อง การใช้คำถูกต้อง อยากให้เค้าให้ความสำคัญพอๆ กับ effect การตัดต่อเท่านั้นเอง
See More
Bodee
retweeted
Amazing Things
@amazingthings_
14 days ago
An incredible wind-powered drummer made entirely from scrap metal
amazingthings_'s tweet video.
Last Seen Users on Sotwe
Mommabear
Seen from
Turkey
HotGayhunks
Seen from
United Kingdom
Enfes Paylaşımlar
Seen from
Turkey
khan baba
Seen from
Turkey
Dilara Dİren
Seen from
Turkey
sabunbolongxxx
Seen from
Indonesia
KTSTNH
Seen from
Turkey
سكس خليجي اجنبي ناااار 🥵💋
Seen from
Kuwait
Andru & rick
Seen from
United States
Kos
Seen from
Indonesia
Trends for you
1
Enes
Under 10K tweets
2
Araujo
Under 10K tweets
3
Mackinac
Under 10K tweets
4
Original Content Rewards
Under 10K tweets
5
Crosby
Under 10K tweets
6
Rey Fenix
Under 10K tweets
7
Bigot
Under 10K tweets
8
#DMDinUSAxTMKTTP
Under 10K tweets
9
Jemele
Under 10K tweets
10
Cassidy
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.2M followers
2
Barack Obama
@barackobama
119.1M followers
3
Cristiano Ronaldo
@cristiano
112.8M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.1M followers
6
Rihanna
@rihanna
98.3M followers
7
NASA
@nasa
92.3M followers
8
Justin Bieber
@justinbieber
91.4M followers
9
KATY PERRY
@katyperry
89M followers
10
Taylor Swift
@taylorswift13
82.9M followers
11
Lady Gaga
@ladygaga
74.4M followers
12
Virat Kohli
@imvkohli
71.8M followers
13
Kim Kardashian
@kimkardashian
70.4M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
64.8M followers
16
Bill Gates
@billgates
64.6M followers
17
The Ellen Show
@theellenshow
62.4M followers
18
Selena Gomez
@selenagomez
62M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.8M followers
Olivia
Online
✨
⭐
💫