รีวิว LangExtract — ดึงข้อมูลจากข้อความด้วย LLM แบบมีที่มาชัดเจน
ข้อมูล Repo
google/langextract- ภาษา
- Python
- ดาว
- 38,919
- สร้างเมื่อ
- แก้ไขล่าสุด
เปลี่ยนสถานะผ่าน API: PATCH /api/reports/fd0157e0-ea90-449d-81b0-547c2cbb5605
แคปชันสำหรับ Facebook
เจอไลบรารีจาก Google ที่ดึงข้อมูลจากข้อความยาว ๆ แล้วไม่ปล่อยให้เชื่อ LLM เปล่า ๆ LangExtract ผูกทุกชิ้นข้อมูลกลับไปตำแหน่งในต้นฉบับได้ และสร้างไฟล์ HTML ให้กดดูผลได้ทันที ✅ source grounding ชัด — ตรวจย้อนกลับได้ ✅ เอกสารยาวใช้ chunking + parallel + multiple passes ✅ รองรับ Gemini, OpenAI และโมเดล local ผ่าน Ollama ✅ ถ้าดึงจากตัวอย่างแทนข้อความจริง จะรู้ได้จาก char_interval = None ✅ มี live demo Romeo & Juliet ในเบราว์เซอร์ก่อนติดตั้งก็ได้ เหมาะกับงานเอกสาร / รายงานที่อยากได้ JSONL แล้ว review ได้ ติดตั้ง: pip install langextract 🔗 https://github.com/google/langextract #Python #LLM #Gemini #InformationExtraction #OpenSource
ภาพปกแบบ HTML สด
แสดงจาก HTML ต้นฉบับที่ใช้สร้างภาพ ดาวน์โหลดเป็น PNG 1080×1350 ได้ทันที
สไตล์ Easy AI
1080×1350แก้ไข 2026-10-10
สไตล์ easy-app
1080×1350แก้ไข 2026-10-10
สรุป
ไลบรารี Python จาก Google ที่ใช้ LLM ดึงข้อมูลเชิงโครงสร้างจากข้อความอิสระ และผูกทุกชิ้นกลับไปตำแหน่งในต้นฉบับ พร้อมสร้าง HTML interactive ให้ตรวจผล รองรับ Gemini, OpenAI และ Ollama
คืออะไร
LangExtract เป็นไลบรารี Python จาก Google ที่ใช้ LLM ดึงข้อมูลเชิงโครงสร้างจากข้อความอิสระ ตาม prompt และ few-shot examples ที่เราเขียน จุดที่ repo ชูคือทุกชิ้นข้อมูลผูกกลับไปตำแหน่งในต้นฉบับได้ (source grounding) และสร้างไฟล์ HTML แบบ interactive เพื่อตรวจผล
ตัวอย่างใน README คือดึงตัวละคร อารมณ์ และความสัมพันธ์จากบท Romeo and Juliet และมี live demo ในเบราว์เซอร์โดยไม่ต้องติดตั้ง
จุดเด่น
- Precise source grounding — ผูก extraction กับตำแหน่งในต้นฉบับ และ highlight ให้ตรวจย้อนกลับได้
- Interactive visualization — สร้าง HTML self-contained ดูผลนับพัน entity ได้
- เอกสารยาว — ใช้ chunking, parallel processing และ multiple passes
- ยืดหยุ่นเรื่องโมเดล — Gemini, OpenAI และโมเดล local ผ่าน Ollama รวมถึงเพิ่ม provider เองผ่าน plugin
- ไม่ต้อง fine-tune — กำหนดงานด้วย prompt + few-shot examples
- กันผลลวงจากตัวอย่าง — ถ้าดึงจาก few-shot แทนข้อความจริง
char_intervalจะเป็นNoneกรองทิ้งได้ - มีตัวอย่าง Vertex AI Batch API สำหรับงานขนาดใหญ่
เหมาะกับใคร
- คนที่อยากเปลี่ยนข้อความยาว (รายงาน, บันทึก, เอกสาร) เป็น JSONL ที่มีที่มาชัด
- ทีมที่อยาก review ผล extraction ไม่ใช่เชื่อ LLM ล้วน ๆ
- คนที่อยากเทียบ Gemini / OpenAI / Ollama ใน pipeline เดียวกัน
เริ่มต้นใช้งาน
pip install langextract
แนะนำใช้ virtual environment:
python -m venv langextract_env
source langextract_env/bin/activate
pip install langextract
ถ้าใช้โมเดลบนคลาวด์ ตั้ง API key (เช่น LANGEXTRACT_API_KEY) ตามส่วน API Key Setup ใน README
ตัวอย่างเรียกใช้แบบย่อจาก README:
result = lx.extract(
text_or_documents=input_text,
prompt_description=prompt,
examples=examples,
model_id="gemini-3.5-flash",
)
ข้อควรรู้
- License: Apache-2.0
- สร้างเมื่อ ก.ค. 2025 | push ล่าสุด 21 ก.ย. 2026
- โมเดล Gemini มี lifecycle / rate limit — ควรดูเอกสารรุ่นโมเดลปัจจุบัน
- ⭐ 38,919 ณ 4 ต.ค. 2026 | ภาษาหลัก Python | open issues 126
🔗 https://github.com/google/langextract
ข้อมูลจาก GitHub ณ 4 ต.ค. 2026: ⭐ 38,919 | ภาษา Python | license Apache-2.0