mirror of
https://github.com/semantica-agi/semantica.git
synced 2026-08-29 04:26:20 +00:00
Seven introduction notebooks linked to a different notebook's filename in their Colab badge (off-by-one numbering), sending readers to the wrong notebook or a 404. Point each badge back at its own file.
7.0 KiB
7.0 KiB
In [ ]:
!pip install semantica
In [ ]:
from semantica.normalize import TextNormalizer
text_normalizer = TextNormalizer()
sample_text = "Hello World!!! This is a test."
normalized = text_normalizer.normalize_text(sample_text, case="lower")
cleaned = text_normalizer.clean_text(sample_text, remove_special_chars=False)
sample_text, normalized, cleaned
In [ ]:
from semantica.normalize import EntityNormalizer
entity_normalizer = EntityNormalizer()
entity_variants = ["Apple Inc.", "Apple Inc", "Apple", "Apple Incorporated"]
normalized_entities = []
for entity in entity_variants:
normalized = entity_normalizer.normalize_entity(entity, entity_type="Organization")
normalized_entities.append(normalized)
print(f"{entity} -> {normalized}")
In [ ]:
from semantica.normalize import DateNormalizer
date_normalizer = DateNormalizer()
date_formats = ["2023-12-25", "12/25/2023", "December 25, 2023", "25 Dec 2023"]
for date_str in date_formats:
normalized = date_normalizer.normalize_date(date_str)
print(f"{date_str} -> {normalized}")
In [ ]:
import importlib
import semantica.normalize.number_normalizer
importlib.reload(semantica.normalize.number_normalizer)
from semantica.normalize import NumberNormalizer
number_normalizer = NumberNormalizer()
numbers = ["1,000", "1.5M", "$100", "50%", "3.14e2"]
for num_str in numbers:
normalized = number_normalizer.normalize_number(num_str)
print(f"{num_str} -> {normalized}")
In [ ]:
from semantica.normalize import DataCleaner
data_cleaner = DataCleaner()
data = [
{"name": "Apple Inc.", "value": 100},
{"name": "Apple Inc", "value": 100},
{"name": "Microsoft", "value": 200}
]
cleaned_data = data_cleaner.clean_data(data, remove_duplicates=True)
print(f"Original records: {len(data)}")
print(f"Cleaned records: {len(cleaned_data)}")
In [ ]:
from semantica.normalize import LanguageDetector, EncodingHandler
language_detector = LanguageDetector()
encoding_handler = EncodingHandler()
text_samples = [
"Hello, this is English text.",
"Bonjour, ceci est du texte français.",
"Hola, este es texto en español."
]
for text in text_samples:
detected_lang = language_detector.detect(text)
print(f"Text: {text[:30]}... -> Language: {detected_lang}")
sample_bytes = "Hello World".encode('utf-8')
detected_encoding = encoding_handler.detect(sample_bytes)
print(f"\nDetected encoding: {detected_encoding}")